AI Scientist for Life Sciences

让 AI 帮助科学家导航不确定性

不是凭空推理新机制,而是审计证据链、选择最能改变判断的下一步,并模拟结果条件下的多步科研策略。
Evidence-chain auditor Next-action recommender Multi-step strategy simulator
叙事版:2026-08-19当前阶段:Paper-to-Decision-Trace原则:事实、设计与猜测分层
1

AI 制药面对的不是一个任务

Context · 从疾病理解到患者获益是一条连续决策链

一个药物项目不是从“模型生成分子”直接抵达患者;它必须连续回答疾病是什么、什么机制可干预、怎样实现干预,以及人体是否真正获益。

Koller 将药物研发拆成三个相连阶段:从疾病找到可改变患者病程的机制,从机制构建具有合适安全性与药理性质的干预,再在临床中识别患者并检验获益。她指出,AI 的显著进展主要集中在第二段,而多数未满足疾病真正缺少的是第一段的正确机制。(Koller, 2026)

局部模型可以优化节点,药物研发必须维护整条链 每一阶段都继承上游的假设、证据、模型边界与未解问题 1 Disease → Mechanism 疾病理解与治疗假设 疾病定义与患者亚型 相关证据与因果机制 靶点、模型系统与 readout 2 Mechanism → Drug 从干预机制到可开发药物 干预方式与分子设计 活性、选择性与安全窗口 assay、剂量与可开发性 3 Drug → Patient 从模型证据到患者获益 模型系统到人体的外推 剂量、安全性与患者选择 临床终点与真实获益 证据门 转化门 同一决策状态持续向下游传递 假设 · 证据 · 模型边界 · 未解问题 错误可能在多年后才以高成本暴露
图 1 · 药物研发不是单个模型任务,而是证据、假设与决策持续传递的跨尺度链路。

结构预测、定义良好的实验空间中的主动学习,以及机器学习研究流程自动化,已经展示 AI 可以强化局部节点;但这些工作的验证对象分别是结构、特定实验空间和机器学习研究流程,并不等于已经完成整条药物研发推理链。(Abramson et al., 2024) (Wang et al., 2020) (Lu et al., 2024)

2

真正困难的是让整条链经得起更新

Problem · 上游错误会在高成本下游才暴露

真正的风险不是某一步预测不够漂亮,而是 AI 在不完整的生物学上更快地产生假设、优化错误目标,并把早期机制错误带到昂贵的下游。

知识 ≠ 答案“更强推理器能从现有文献中找出疗法”假设我们已经测量了足够的人类生物学。Koller 的判断相反:生物学过于复杂且依赖具体上下文,必须继续真实测量,而不能在抽象知识上凭空推演。(Koller, 2026)
快循环 ≠ 对目标Agent 在快速、准确、便宜的 scorecard 下擅长迭代;药物的最终反馈却是耗时多年的人体临床获益。若代理目标不能代表患者获益,更快优化只会更快走向错误方向。(Koller, 2026)
暴露晚 ≠ 起因晚很多药物在临床才宣告失败,但问题往往来自更早的 disease-to-mechanism 判断:分子可能按要求被制造出来,却作用于错误的生物学机制。(Koller, 2026)

证据也不是同质的。Minikel 等估计,有人类遗传支持的药物机制具有更高的临床成功概率,但同时明确提醒:这不意味着大量遗传关联都会自动成为成功靶点。(Minikel et al., 2024)

与此同时,可用于靶点选择的证据持续增长,但文献关联快速增加并未等比例产生新的独特靶点;更多信息不会自动给出更好的路线。(Falaguera et al., 2025)

因此,本项目重新定义 AI Scientist 的任务:它不是替生命科学寻找“魔法棒”,而是在超长反馈链中持续维护证据与不确定性,选择最能改变判断的计算或实验,并让真实结果触发路线更新。

单点模型回答什么

某个结构、分子、表型或实验结果最可能是什么;它通常假设任务边界和评价目标已经给定。

整条推理链还需要什么

为什么相信当前机制、替代解释是什么、下一步如何区分、结果怎样改变后续路线,以及何时停止。

边界:本项目把 AI Scientist 限定为组织和审计推理体系;它仍不能凭空补上扰动数据、人体证据或未被公开记录的实验历史。
3

核心改变是什么

Thesis · AI Scientist 的对象是可更新的科研决策状态
核心改变:从“生成答案”转向“运行决策循环” 产品对象由一个结论,变成可检查、可更新、可执行的科研决策状态 Answer-first 问题或主题 不可见的生成过程 单一结论或计划 流畅性可能掩盖证据缺口 改变对象 Decision-first AI Scientist 每一步都读取并写回同一状态 审计证据链 来源 · 类型 · 边界 保持竞争假设 未知 · 分歧 · 置信度 科研决策状态 证据 + 假设 + 约束 + 未知 推荐下一步行动 组合 · 排序 · 决策规则 观察并更新 真实结果 · 信念更新 多步策略模拟器 预演结果 A / B / C,形成条件策略树 advance / revise / hold / stop
图 2 · Decision-first AI Scientist 是围绕同一科研决策状态运行的闭环;多步策略是对整套闭环的条件分支预演。
系统角色必须回答的问题输出
证据链审计器结论由什么观察支持?证据类型、模型与边界是什么?claim-evidence graph、locator、反证与缺口
下一步行动推荐器哪个实验或计算最能区分竞争假设,同时可执行?排序后的 action portfolio 与 decision rule
多步策略模拟器结果 A/B/C 分别触发什么下一步或停止?条件策略树与 belief update
4

落地路线:学习科研、构建工具、训练科学大脑

Route · 两类基础共同供给一个持续学习的决策闭环

真正的落地不是先做一个“大而全”的 Agent,而是先重建科研经验、形式化可调用能力,再让决策机制在真实反馈中学习怎样收敛不确定性。

科学大脑由科研经验与可调用能力共同支撑 支撑层提供决策输入;真实结果反过来增强经验语料、知识与工具边界 3 科学大脑:在给定上下文中选择试错路径 读取支撑层,写回增强后的经验与能力 当前科研决策状态 研究问题 + 证据 + 竞争假设 + 关键未知 + 现实约束 + 可用能力 1 判定关键未知 哪个未知阻止判断? 2 生成候选路径 计算与实验组合 3 评价并选择 区分力 · 信息增益 · 可行性 4 执行定向试验 提高关键判断精度 5 观察并更新 结果改变信念与路线 关键未知仍未收敛 → 带着更新后的状态进入下一轮 结果 A / B / C → advance / revise / hold / stop 阶段性输出:带证据强度、适用边界和下一步条件的科学结论 真实结果写回:科研经验 · 科学知识 · 工具边界 · 不确定性判据 经验状态与备选路径 重建结果与新经验 可用能力与调用约束 知识与工具边界更新 1 科研经验层 Decision-Trace Corpus 来源:论文 · 专利 · 方法协议 · 报道 / 注册 · 复现 / 负结果 恢复:决策点 · 竞争假设 · 选择理由 · 结果与不确定性更新 [猜测] 公开记录偏向胜利路线;未记录的尝试与放弃理由仍不可见 2 科研能力层 Capability Registry 研究方法论 · 科学知识 · 计算工具 · 生物实验 能力契约:场景 · 前提 · 输入输出 · 边界 · 失败模式 调用约束:可用性 · 质量控制 · 成本时间 · 风险
图 3 · 下方两类支撑层分别提供可学习的决策经验和可执行的行动空间;科学大脑负责选择、试验、更新,并用真实结果持续增强经验与能力边界。
1

重建科研经验与备选路径空间

先学会读懂科研过程
收集什么
论文、补充材料、专利、公共数据、方法协议、注册信息,以及可获得的复制研究、负结果与研究报道;保留时间、版本与来源定位。
恢复什么
显式证据链、关键决策 episode、当时的竞争假设、候选行动、选择理由、预期观察、停止条件和不确定性更新节点。
怎样补齐缺失路线
跨来源对照、专家访谈、领域方法模板与反事实候选生成共同扩展备选空间;所有内容必须区分 documentedinferredunknown
边界:补出的路线是“在当时条件下可能合理的选项”,不是对作者实验室未公开历史的事实性复原。
2

把科研工具变成有边界的可调用能力

定义系统能做什么
四类基础库
研究方法论库描述实验设计、统计和因果判定;科学知识库维护实体、机制与证据;计算工具库封装分析能力;生物实验能力库描述模型、协议和 readout。
每项能力的契约
明确使用场景、输入输出、前置条件、关键假设、有效范围、失败模式、质量控制、成本时间、风险以及结果能够更新哪一种不确定性。
调用纪律
决策机制只能选择满足前置条件、能产生可解释观察、且边界与当前问题匹配的能力;工具不可用本身也是路径选择约束。
3

构建在上下文中选择试错路径的科学大脑

项目的核心能力
形成决策状态
同时读取问题定义、当前证据、竞争假设、不确定性、预算时间、样本与平台条件,以及上一步结果和可用工具。
生成与选择路径
产生多个行动组合,按区分竞争假设的能力、预期信息增益、因果有效性、可执行性、成本、时间和风险进行透明比较,并预先写出结果条件下的决策规则。
执行、更新与学习
用计算或特定实验提高关键判定精度;真实观察触发 advance / revise / hold / stop,同时更新知识体系、工具边界、不确定性判据和可复用决策经验。
“优选路径”的含义:不是声称找到全局最优路线或保证成功,而是在显式上下文、可用能力与评价准则下给出当前可比较、可复核的选择;其排序质量必须通过历史遮蔽评测和真实项目反馈持续校准。
5

案例第一步:不是先选模型,而是构造决策空间

Multimodal Cell Maps · 领域知识、计算工具和实验能力共同定义第一轮行动

面对“怎样系统描述细胞内蛋白组织”这个大问题,第一步不是要求 AI 给出一个机制,而是把它拆成当前可以观察、计算、验证和暂时保留的未知。

Scientific objective
如何把物理相互作用与亚细胞定位整合成可检验的细胞组织图谱,而不是把某一种测量误当成完整结构? (Schaffer et al., 2025)

领域知识:先判断缺哪类证据

蛋白质相互作用和空间定位描述的是不同维度;单一模态可能遗漏不同尺度的组装。因此,互补性本身成为拆解问题的依据。

  • 已知参照:CORUM、GO、HPA 中的复合物与定位
  • 模型边界:U2OS 是具体细胞背景,不能自动外推到所有细胞类型
  • 关键未知:融合后出现的新 assembly 是生物结构,还是数据与模型共同造成的表象?

计算工具:比较怎样整合

论文报告了三种可比较的表示路线。[猜测]在决策重建中,它们构成“怎样融合”的候选行动,而不是预设自监督一定正确。

  • 简单拼接:保留两种输入,但不主动学习跨模态结构
  • 监督模型:用 GO 语义相似度训练 random forest
  • 自监督融合:同时保留模态信息并学习共同表示,再进行多尺度 community detection

实验能力:决定哪些未知可被行动

可用平台把抽象疑问变成不同成本、不同证据强度的行动组合;每一种 readout 只能更新特定不确定性。

  • 发现层:AP-MS 测相互作用,IF 测空间定位
  • 正交验证:SEC-MS 检查同一 assembly 内蛋白是否呈共洗脱相似性
  • 功能与结构追问:扰动加 qPCR、Perturb-seq、AlphaFold/整合结构建模
进入科学大脑的不是一张结果表科学目标、当前证据、竞争解释、模型与平台边界,以及每项行动能产生什么观察。
第一轮输出是一组带判据的选择先融合哪些证据、怎样比较表示方法、何时需要正交测量;观察返回后,再重新定义下一轮最关键的未知。
重建边界:论文明确报告了数据、方法比较和验证结果;这里把它们组织成决策空间,是我们的分析性重建。除非原文明确说明,不能把这套结构当作作者实验室真实的历史顺序或完整备选路线。
6

科研推进不是一条 Pipeline,而是连续改变判断

Decision trace · 每次观察都重新定义下一步值得解决的未知

Multimodal Cell Maps 的价值不只在于得到 275 个 assemblies;它让我们看到一条从互补测量、计算比较、正交验证到局部功能追问的多轮证据更新链。

两种测量能否形成更完整的表示?
当前证据与行动对匹配蛋白获取 AP-MS 相互作用特征和 IF 图像特征;共覆盖 5,147 个蛋白。
观察单独使用 IF 偏向恢复大型 assemblies,单独使用 AP-MS 偏向较小 assemblies;融合图谱还恢复了单模态未解析的 assemblies。
状态更新“两种模态提供互补信息”得到支持,下一未知转为:怎样融合才不会只复制已有标签或任一模态的偏差?
哪种计算表示更值得进入发现阶段?
候选与判据比较简单拼接、GO 监督 random forest 与自监督多模态表示;用 STRING、CORUM 和 Perturb-seq 等外部关系检验恢复能力。
观察论文报告自监督表示在这些物理与功能关系上具有更强或有竞争力的富集表现,并据此构建多尺度图谱。
状态更新形成 275 个候选 assemblies,但“计算上稳定”仍不等于“生物学上真实”;下一步需要独立于 AP-MS 与 IF 的证据。
候选 assembly 是否获得正交支持?
行动与判据在同一 U2OS 背景开展全蛋白组 SEC-MS;若 assembly 内蛋白的洗脱谱显著相似,则增加其共同组装的可信度。
观察论文报告 SEC-MS 与图谱 assemblies 存在显著一致性,并对部分意外成员提供共洗脱支持。
状态更新被支持的 assembly 置信度提高;未被支持者不能被简单判错,还要区分动态相互作用、测量覆盖与模型阈值等解释。
从图谱关联走向可干预的功能假设
DPP9 局部回路AP-MS 在 STAT2 pull-down 中关联 DPP9;IF 显示其与 ISGF3 蛋白具有相似胞质定位,由此提出 DPP9 参与干扰素调控的假设。
行动与观察使用 1G244 抑制 DPP9 后,论文报告多个 canonical ISG readout 上调,而非 ISG 对照未改变。
状态更新结果支持 DPP9 在该实验背景下抑制 IFN response;它没有单独证明直接作用、普适性或完整机制,新的未知继续进入后续迭代。
这才是 AI Scientist 要学习的对象:领域知识与工具先给出可行动空间;真实观察只更新特定判断;更新后的证据状态再次触发候选行动、判定规则和停止条件。(Schaffer et al., 2025)
7

AI Scientist 要在“不知道后文”的时点接受检验

Learning & evaluation · 不复述论文,而是在历史信息截点上重建下一步

我们把同一研究切成四个 cutoff:每次只暴露当时可获得的证据,要求系统生成决策状态、行动组合、预期观察与更新规则,再与论文路线和专家替代路线比较。

C0
系统可见科学目标 + 领域背景 + 可用平台
尚未看到 AP-MS、IF 或任何后续结果。
必须产出拆出“相互作用、定位、组装真实性、功能作用”等不同未知;说明领域先验与证据缺口,不直接给机制答案。
怎样评价关键未知覆盖、证据类型匹配、不可回答问题的 abstention,以及是否考虑模型系统和测量边界。
C1
系统可见AP-MS + IF 数据与质量控制
隐藏 embedding 比较、assemblies 和后续验证。
必须产出简单拼接、监督与自监督等计算路线;为每条路线写前置条件、失败模式、比较指标和选择规则。
怎样评价是否避免 GO 标签循环、是否使用外部物理/功能参照、是否把 robustness 与 biological validity 分开。
C2
系统可见候选 assemblies + 算法稳定性
隐藏 SEC-MS、结构和功能验证结果。
必须产出生成正交验证组合,并说明每项行动能排除哪些替代解释;对 null result 预先定义 revise / hold / stop。
怎样评价信息增量、正交性、成本与覆盖权衡,以及结果是否真正改变 assembly 置信度而非只增加数据量。
C3
系统可见DPP9-ISGF3 的 AP-MS + IF 关联
隐藏抑制实验与 qPCR 结果。
必须产出提出关联、功能和直接机制的分层假设;选择扰动、readout、对照、剂量时间与后续 rescue / orthogonal validation。
怎样评价能否区分“支持调控作用”与“证明直接机制”,并在结果返回后恰当升级、降级或保留不确定性。
已有骨架DiscoveryPacket、decision episode、action、belief update、strategy transition 与六阶段可审计抽取流程已经存在于仓库。
本案例新增工作为 Schaffer 2025 建立 source map、evidence ledger、decision trace、multimodal capability registry 和四个 cutoff-safe blind tasks。
通过标准来源定位可靠;不偷看未来;候选行动覆盖合理替代路线;判据可执行;更新强度与证据相称,并由独立专家 adjudicate。
当前实现边界:仓库已有表示与抽取骨架,但尚未完成这个案例的正式 packet、capability registry、cutoff runner 或专家评测。因此,这三页展示的是下一阶段可检验的实现方案,不是已经验证的系统效果。
8

先证明一个工作流有价值,再谈平台

Positioning · 把商业故事变成可证伪的使用假设

[猜测]第一个合理落点不是“自主发现药物”,而是高不确定性项目的机制与实验路线 review:把分散证据变成可审计状态,让团队比较下一步,而不是替团队批准项目。

使用时刻[猜测]转化研究或早期发现团队,在机制 review、靶点 review、实验路线评审或结果矛盾时使用
读取上下文外部文献、内部可公开给系统的数据、当前假设、历史实验、预算时间、样本与平台能力
交付决策状态source-grounded decision packet、竞争假设、关键未知、候选行动组合、decision rule、abstention 与更新日志
边界写在交付里不提供未经引用的新机制、未经校准的成功概率、自动批准 / 停止项目或无人工监督的湿实验执行
01回溯盲测
怎么做隐藏未来结果,让系统和专家分别重建问题、生成行动并解释更新
测什么locator 准确率、unsupported claim rate、替代路线覆盖、因果有效性、uncertainty calibration、专家分歧
不过关意味着不能进入真实项目;继续修 schema、prompt、证据边界和错误分类
02影子模式
怎么做跟随正在进行的项目,但建议不直接触发实验;与团队原决策并行记录
测什么review 时间、遗漏证据与替代路线数、采纳 / 拒绝理由、反证后的修订质量、人工复核成本
不过关意味着若不能产生可解释的信息增量,停止扩大集成和商业承诺
03受控前瞻
怎么做由团队选择窄问题和有限行动;真实观察进入 update loop,保留所有 advance / revise / hold / stop 记录
测什么建议是否改变行动排序、结果是否按 decision rule 更新、abstention 是否恰当、是否出现安全或证据越界
不过关意味着任何自动化范围只由已通过的能力和风险门决定,不从单次成功外推
  1. 01
    [猜测]团队是否愿意反复使用,而不是只看一次报告?
    最小证据同一项目多轮 review 与更新记录,而不是一次性 demo 反馈
  2. 02
    [猜测]价值是否超过人工整理与复核成本?
    最小证据前后对照的总耗时、返工、错误修订和专家投入
  3. 03
    [猜测]组织是否愿意提供足以形成真实上下文的数据?
    最小证据在权限、审计和保密约束下完成一项内部数据 pilot
  4. 04
    [猜测]decision trace 是否形成可积累资产?
    最小证据跨项目复用后仍保留来源、适用边界、版本与结果反馈,而不是沉淀成无上下文文本
[猜测] 商业纪律:在客户访谈、重复使用、工作流对照和结果测量完成之前,不主张市场规模、节省比例、收入模型或“组织级科研记忆”已经成立。
9

引用与主张边界

Evidence · 让演示本身也可审计
  1. Koller (2026). Drug Discovery Has No Magic Wands: On AI, human biology, and what it will actually take to discover transformative new medicines. a16z, August 3, 2026. 本地网页快照
  2. Koller (2024). Daphne Koller on Drug Discovery and AI. Possible interview transcript, September 4, 2024. 本地访谈全文
  3. Guggenheim (2026). AI & Tech brief: Daphne Koller on AI-powered drug discovery. The Washington Post, WP Intelligence, April 29, 2026. 本地证据摘记
  4. Abramson et al. (2024). Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature. doi:10.1038/s41586-024-07487-w. 本地全文
  5. Lu et al. (2024). The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. arXiv:2408.06292. 本地预印本
  6. Wang et al. (2020). Accelerated knowledge discovery from omics data by optimal experimental design. Nature Communications. doi:10.1038/s41467-020-18785-y. 本地全文
  7. Schaffer et al. (2025). Multimodal cell maps as a foundation for structural and functional genomics. Nature. doi:10.1038/s41586-025-08878-3. 本地全文
  8. Minikel et al. (2024). Refining the impact of genetic evidence on clinical success. Nature. doi:10.1038/s41586-024-07316-0. 本地全文
  9. Falaguera et al. (2025). Temporal trends in evidence supporting novel drug target discovery. Nature Communications. doi:10.1038/s41467-025-67180-y. 本地全文
  10. Sharma et al. (2010). A chromatin-mediated reversible drug-tolerant state in cancer cell subpopulations. Cell. doi:10.1016/j.cell.2010.02.027. 本地作者手稿文本
  11. Errington et al. (2021). Partial replication: A chromatin-mediated reversible drug-tolerant state in cancer cell subpopulations. eLife. doi:10.7554/eLife.73430. 本地全文
外部事实:作者—年份引用仓库状态:标注仓库事实未来与商业:标注 [猜测]

完整证据登记、使用边界和本地资源说明见 presentation/REFERENCES.mdpresentation/references/README.md