CHA Love Letter AI차러브레터AI
생명과학 · Nature Machine Intelligence

지식 그래프로 미프로파일 약물의 단일세포 반응을 제로샷 예측

14개 공공자원 통합한 MAP‑KG와 대비학습으로 모델 일반화 성능 개선 확인

글 석해인 기자Chemical Biology · 2026.09.30조회 50
89AI 심사
기사 내용을 표현한 삽화
AI로 만든 삽화예요. 논문 속 실제 자료가 아니에요.

상하이교통대, 상하이인공지능연구소, 하버드의대 등 국제 공동연구진이 이번 연구를 수행했으며 논문은 Nature Machine Intelligence에 2026년 8월 26일 게재되었다. 연구진은 14개 공공 자원을 통합해 MAP‑KG라는 지식그래프를 만들었고, 이 그래프는 187,089개 약물·22,924개 유전자·694,246개의 메커니즘 관계를 연결한다고 밝혔다. 이 기반 위에 분자구조·단백질서열·문헌 기반 작용 기술문을 정렬하는 지식기반 사전학습 전략과 단일세포 예측기를 결합한 프레임워크 MAP을 제안했다.

핵심 결과로 연구진은 MAP를 두 가지 제로샷 평가 설정에서 검증했다고 밝혔다. 첫째, 관찰되지 않은 세포타입–약물 조합(제로샷 조합 일반화)에서는 Tahoe‑100M에서 top‑50 DEG Pearson delta 상관이 최대 +12.3% 향상되고, SciPlex3에서는 +6.6% 개선, OP3에서는 direction accuracy가 +6.7% 개선되는 등 데이터셋별로 유의한 개선을 보였다고 보고했다. 둘째, 전혀 프로파일이 없는 미프로파일 약물(제로샷 미프로파일) 설정에서는 Tahoe‑100M에서 +11.8%, OP3에서 +19.8%, SciPlex3에서 +10.4%의 top‑50 DEG Pearson delta 상관 개선을 기존 최강 기준보다 기록했다고 밝혔다. 추가로 MAP는 여러 보완적 지표(방향 일치성, 분리도, MSE, 분포 유사성)에서도 전반적 향상을 보고했다.

방법 측면에서 연구진은 MAP‑KG의 다중 속성(예: SMILES, 단백질 서열, 작용 설명)을 모달리티별 인코더로 임베딩하고, 대비학습(contrastive learning)을 통해 이들 임베딩을 공통 표현 공간으로 정렬했다고 설명했다. 제로샷 미프로파일 평가에서는 정보 누출을 막기 위해 테스트용으로 보류한 약물의 모든 교란 프로파일뿐 아니라 해당 약물 엔터티와 관련 관계를 MAP‑KG에서 제거해, 테스트 시 예측이 오직 남아있는 속성(예: 분자구조·주석)에만 의존하도록 설계했다고 밝혔다. 또한 경로 수준의 유전자집합증감분석(GSEA)을 사용해 기능적 일관성을 평가했으며, A‑549 세포를 대상으로 한 가상 스크리닝에서는 검증용 58개 보류 약물 가운데 네 가지 승인 폐암 약물이 상위 15위 이내에 포함되었고, 그중 adagrasib와 afatinib는 각각 2위와 4위로 보고되었다.

논문은 MAP의 한계로서 모델의 제약이 주로 이용 가능한 약물·유전자 속성에 의존함을 명시했다. 즉, 속성 정보가 불완전하거나 누락된 경우 제로샷 예측 능력이 제한될 수 있고, 이에 대응해 연구진은 테스트 약물과 관련한 엔터티·간선들을 사전학습에서 제거해 정보 유출을 통제했다고 밝혔다. 또한 연구는 다양한 데이터셋과 지표에서의 성능 향상을 보였으나, 결과 해석과 활용은 제시한 벤치마크와 평가 설정 범위 안에서 이뤄졌음을 분명히 했다.

배경과 남은 과제로 연구진은 체계적 기계학습에 생물학적 기계적 지식을 주입하면 대규모 가상 스크리닝에서의 제로샷 일반화에 유리한 보완축이 될 수 있음을 제시한다. 논문은 기계적 지식의 확장(스케일링)이 데이터와 모델 용량에 더해 제로샷 성능을 추가로 끌어올리는 결과를 보였다고 결론지었다.

원문 논문

제목
A knowledge-driven framework for predicting single-cell responses for unprofiled drugs
저널
Nature Machine Intelligence (2026-08-26)
저자
Jinghao Feng, Ziheng Zhao, Xiaoman Zhang, Mingfei Liu 외 7명
DOI
10.1038/s42256-026-01286-w
라이선스
CC BY-NC-ND 4.0

상하이교통대와 상하이인공지능연구소, 그리고 하버드의대 연구진이 함께 힘을 모아 아주 흥미로운 연구를 했어요. 이들은 Nature Machine Intelligence라는 유명한 학술지에 2026년 8월 26일 논문을 발표했답니다. 연구진은 14개의 공공 자원을 합쳐 ‘MAP-KG’라는 거대한 지식그래프를 만들었는데, 여기엔 약 18만7천 개의 약물, 2만2천 개가 넘는 유전자, 그리고 거의 70만 개에 가까운 메커니즘 관계가 연결되어 있어요. 쉽게 말해, 약물과 유전자 사이의 수많은 연결고리를 한눈에 볼 수 있는 큰 지식 지도 같은 거죠.

이 지식그래프를 바탕으로 연구진은 ‘MAP’라는 새로운 인공지능 프레임워크를 제안했어요. 이 시스템은 분자 구조와 단백질 서열, 그리고 관련 논문 속 작용 설명을 모두 모아서 학습한 뒤, 특정 세포가 어떤 약물에 어떻게 반응할지 예측할 수 있게 해줍니다. 특히 두 가지 ‘제로샷’ 평가를 통해 검증했는데, 첫 번째는 한 번도 본 적 없는 세포-약물 조합에 대한 예측, 두 번째는 아예 프로파일 정보가 없는 약물에 대한 예측이었어요. 결과는 정말 놀라웠답니다. 여러 데이터셋에서 기존보다 6%에서 19%까지 성능이 향상되어, 훨씬 정확한 예측이 가능해졌다는 거예요.

방법을 조금 더 들여다보면, 연구진은 SMILES라는 분자 구조 표현, 단백질 서열, 그리고 작용 설명을 각각 따로따로 인코딩해서 하나의 공통된 표현 공간으로 맞췄어요. 그리고 테스트할 때는 정보가 새어나가지 않도록, 예측할 약물과 관련된 모든 데이터를 지식그래프에서 빼서 오직 남은 속성 정보만으로 결과를 내도록 했답니다. 또, 특정 폐암 세포를 대상으로 한 가상 스크리닝에서는 58개의 약물 중 네 가지가 상위 15위 안에 들었고, 그중 두 가지 약물이 각각 2위와 4위에 올랐어요. 이건 실제 약물 개발에도 큰 도움이 될 수 있는 결과였죠.

하지만 연구진도 MAP의 한계점을 솔직하게 말했어요. 약물이나 유전자에 대한 속성 정보가 부족하면 예측이 어려워지고, 그래서 테스트용 약물 관련 정보를 아예 빼놓는 방법으로 정보 누출을 막았다고 해요. 그리고 이 연구는 여러 데이터셋과 지표에서 좋은 성과를 냈지만, 결과 해석과 활용은 정해진 평가 범위 안에서만 신중히 해야 한다고 강조했답니다. 앞으로는 이런 생물학적 지식을 기계학습에 더 잘 녹여내서, 새로운 약물을 빠르고 정확하게 찾아내는 데 큰 도움이 될 거라고 기대하고 있어요.

이 기사가 만들어진 과정

초안: LUMEN Gemma 4 · AI 심사 6회 · 최종 확인·발행: 석해인 기자

AI 심사위원판정점수
GPT-4o mini (OpenAI)REVISE82
gpt-oss-120b (Cerebras)PASS92
GLM-5.3-Flash (Zhipu)PASS93
Kimi-K2.6 (Moonshot)REVISE85
Qwen3.5-9B (Alibaba)PASS94

통과 기준: 3명 이상 응답, 응답자의 절반 이상 통과, 평균 80점 이상. 채점 항목은 사실정확성·소스충실도·논리성·균형·가독성이에요.

← 다른 기사 보기