IterMix Matrix
Iterative Molecular Interaction Matrix
机制知识、计算模型与实验闭环的公司级科学资产
机制知识、计算模型与实验闭环的公司级科学资产
Iterative EvolutionMolecular Interaction三引擎闭环可验证决策
事实:需有可审计依据战略判断:当前取舍[猜测/待验证]:不可当作业绩
1
战略判断
Strategic Thesis · 有高度,但必须可验收核心价值不在“关系多”,而在持续增值
Matrix 的战略意义,是把每一次阅读、计算、模型迭代和实验,沉淀为下一次研发决策能够复用、校验和更新的公司资产。它把竞争单位从单一模型或一次项目交付,提升为持续学习的科学研发系统。
| 具备战略高度的条件 | 退化为普通概念的表现 |
|---|---|
| 同一资产底座连接知识、计算、实验和决策 | 只是把公开 PPI 和论文集中到一个图数据库 |
| 每条主张带上下文、证据、冲突和不确定性 | 所有关系被压成无条件的 A–B 边 |
| 实验针对关键不确定性,结果能够改变下一步 | 湿实验只是给模型结果补一个“验证”标签 |
| 在冻结评测和真实项目上证明决策增量 | 用数据库规模、算力或流畅解释代替效果证据 |
名称本身就是战略
品牌定义:
IterMix = Iterative Molecular Interaction Matrix。Iter 描述持续迭代和 AI 自进化;Mix 中的 M 明确代表 Molecular,I 代表 Interaction,Molecular Interaction Matrix 是核心科学资产;IterMix Brain 是驱动资产更新和应用的系统。| 名称 | 角色 | 回答的问题 |
|---|---|---|
| IterMix | 公司 | 围绕什么长期使命和资产开展业务 |
| IterMix Matrix | 核心科学资产 | 公司积累什么,并如何形成可复用证据 |
| IterMix Brain | AI 科学研发系统 | 如何读取、推演、验证和更新 Matrix |
| deepcell_brain | 当前工程仓库 | 现阶段如何实现 IterMix Brain |
建议定位: IterMix Matrix 是机制知识与研发决策资产;IterMix Brain 是读取、推演、更新和使用这些资产的 AI 科学研发操作系统。
[猜测/待验证]: Matrix 能否成为竞争壁垒,取决于专有上下文证据、负结果、模型校准和真实决策收益,而不是命名或数据量本身。
2
Matrix 的严格定义
Definition · 先统一对象,再谈概率和智能定义: IterMix Matrix 是一个上下文条件化、证据可追溯、不确定性可表达、可被计算模型和实验持续更新的机制知识与研发决策系统。
它不是静态 PPI 数据库,不是某个基础模型,也不应被描述为已经实现的完整数字细胞。名称中的 Matrix 表示多层关系和状态的组织方式,不意味着系统必须存成一个二维矩阵。
2.1 最小知识单元
图 1 · 一条可用于研发决策的机制主张,必须携带上下文、证据与不确定性。
2.2 建议覆盖范围
| 层 | 核心对象 | 代表内容 |
|---|---|---|
| 实体层 | 分子与生物对象 | 基因、isoform、蛋白、复合物、PTM、药物、抗体、细胞和疾病 |
| 机制层 | 有类型的作用 | 结合、催化、调控、稳定性、降解、转位、遗传互作和状态转移 |
| 上下文层 | 成立条件 | 物种、组织、细胞、疾病、区室、剂量、时间、扰动和 assay |
| 证据层 | 支持与反对 | 数据库、原始实验、文献、专家、计算预测、负结果和冲突 |
| 决策层 | 研发过程对象 | 假设、候选、实验、结果、失败、gate 和项目 lineage |
3
总体架构
Architecture · 三个引擎更新一个资产底座总体架构的关键不是把更多模块画进来,而是保持证据类型和职责边界:知识主张、计算预测、实验观察和最终决策在 Matrix 中彼此关联,但不互相冒充。
图 2 · 三个驱动力进入同一个 Matrix,并服务于靶点、机制、设计和验证决策。
| 系统 | 职责 | 不能越过的边界 |
|---|---|---|
| Matrix | 保存版本化实体、主张、证据、模型输出、实验和决策状态 | 不把未验证预测自动升级为事实 |
| IterMix Macro | 定义问题、形成竞争假设、选择路线和验证策略 | 不以语言合理性替代科学证据 |
| IterMix Micro | 优化垂直模型、数据、训练和 pipeline | 不访问或反复适配锁定认证答案 |
| Independent Evaluation | 隔离评测、泄漏控制、认证和外部验证 | 不参与候选模型生成 |
4
三个驱动力
Operating Flywheel · 每个引擎都要改变共享状态图 3 · 三个体系不能各自交付报告,而要共同更新主张、证据、不确定性和下一步。
知识引擎
将文献、数据库和专家判断转成可审计的机制主张。优先建设实体消歧、事件抽取、证据分级、冲突保留、负结果和专家 gold set;先形成可控 harness,再根据真实纠错数据判断是否需要 LLM 微调。
计算引擎
组织细胞扰动、结构、复合物、docking、亲和力、稳定性、动力学和生成模型。每项输出必须绑定 checkpoint、训练数据来源、输入上下文、适用域、benchmark 和不确定性。
实验引擎
自建、合作和 CRO 都通过统一 manifest 与 QC 接入。实验选择以能否缩小关键不确定性、改变决策为中心,而不是只按模型置信度或候选分数排序。
[猜测/待验证]: 物理先验、AI 模型迭代和定向实验的组合可能带来持续领先;必须逐任务通过冻结 benchmark 和前瞻实验证明,不能从个别模型外推。
5
概率与决策逻辑
Method · 避免把“关系图”包装成全局概率真相1
关系边不是天然的概率分布
数学边界为什么
边只是表示结构;关系存在性、方向、效应量或结果才可以作为随机变量。怎么做
表达 P(relation, sign, effect | evidence, context),并保留证据组成。避免
宣称已经学习了全细胞范围的严格联合分布。2
相关预测不能自动升级为因果结论
因果边界为什么
文本共现、观察数据和普通预测模型不能识别所有混杂因素。怎么做
区分 association、mechanistic claim、causal hypothesis 与 intervention evidence。避免
在没有干预设计或充分识别假设时使用确定性的因果语言。3
不确定性必须能够指导下一步
可行动性为什么
证据、模型、生物随机性和多目标决策的不确定性来源不同。怎么做
分别记录四类不确定性,并评估哪个实验最可能改变当前决策。避免
把所有来源压成一个看似精确的 confidence score。目标形式: 对具体问题构建上下文子图和任务模型,估计条件结果、实验结果与决策效用;在真正满足干预识别条件时,才讨论 P(Y | do(X), context, evidence)。
6
首个纵向切片
MVP · 扰动预测与机制解释共同验收当前两个任务可以成为 Matrix 的第一条真实链路:微观引擎在 K562 扰动预测上优化专业模型;宏观能力将预测转成证据受约束的竞争机制假设,再由专家和实验进行区分。
图 4 · 首批 MVP 的价值,是能够对失败做联合归因,而不是分别制作两个演示。
| 任务 | Matrix 新增资产 | 验收重点 |
|---|---|---|
| 扰动预测内环 | 版本化 DEG、通路、状态变化、OOD 和不确定性 | 冻结认证集上的真实提升、复现和失败诊断 |
| 机制解释 | 支持/冲突证据、竞争假设、上下文边界和验证方案 | 证据准确、因果克制、专家盲评和可区分实验 |
必须阻断: 预测错误但 LLM 生成了流畅解释;以及训练时使用的通路先验再次被当作独立评测真值。
7
壁垒与衡量
Moat & Metrics · 只有增量价值才能形成资产壁垒可能有差异化的资产
上下文机制主张正负实验结果专家冲突标注模型适用域记录决策与失败轨迹跨尺度证据链
公开数据简单汇总单一模型排行榜不可追溯的 LLM 解释没有对照的成功故事
| 层级 | 建议核心指标 |
|---|---|
| 知识质量 | 实体消歧和关系精度、provenance 完整率、上下文覆盖、冲突发现与处理 |
| 模型质量 | OOD 提升、校准、复现率、认证结果、单位提升所需算力和实验 |
| 实验质量 | 重复性、QC、前瞻 hit rate、信息增益、改变决策的比例 |
| 业务价值 | 从问题到可验证假设的时间、每个验证候选成本、资产复用的增量贡献 |
[猜测/待验证]: “缩短研发周期、提高成功率、降低成本”目前只能作为目标;必须有对照项目或纵向记录后,才能升级为 BP 中的已验证结论。
8
阶段路线与 BP 叙事
Roadmap · 以验收 gate 控制战略范围| 阶段 | 核心交付 | Go / No-Go |
|---|---|---|
| Phase 0 统一语言 | Ontology v0.1;Claim / Evidence / Prediction / Experiment / Decision 对象;许可与治理 | 同一主张能否跨团队一致录入、查询和追溯 |
| Phase 1 扰动纵向切片 | K562 模型内环;单 KO 机制子图;竞争假设;专家盲评 | 能否区分模型失败、解释失败和证据不足 |
| Phase 2 靶点与蛋白机制 | target prioritization;结构、复合物、稳定性、活性和亲和力证据 | 能否支持一个真实项目的可审计机制决策 |
| Phase 3 分子设计闭环 | 多目标候选设计、实验选择与完整 DBTL 轨迹 | 是否优于冻结的专家或计算 baseline |
| Phase 4 跨项目学习 | 可验证训练轨迹、协调模型升级和策略复用 | 旧项目资产是否给新项目带来可量化增量 |
BP 的一句话
建议表述: IterMix 正在构建以机制证据为核心的 Molecular Interaction Matrix,并以 AI 知识引擎、高精度计算引擎和定向实验引擎持续更新它,使细胞状态理解、靶点判断和分子设计成为同一条可追溯、可验证、可进化的研发链。
推荐讲述顺序
- 证据碎片化与上下文依赖的行业问题。
- Matrix 如何保存机制、证据、冲突和不确定性。
- 知识、计算、实验三引擎形成增长飞轮。
- IterMix Brain 如何同时优化专业模型和科学过程。
- 用扰动预测和机制解释证明首个纵向闭环。
- 再延展到靶点、蛋白机制、分子和抗体设计。
- 只用已审计的 benchmark、实验和项目结果证明能力。
下一轮管理层对齐
证据说明: 支撑性公开资料和完整风险论证见配套 Markdown 文档《IterMix Matrix:机制知识、计算模型与实验闭环的公司级科学资产》。