iterMix_brain 系统架构全景

从科学战略编排,到专业模型优化,再到可验证的学习闭环
Strategy-to-Execution Architecture for AI-native Biomedical R&D
双模型体系宏观 + 微观双引擎独立评测治理DBTL 闭环
版本: Meeting v1受众: 战略与研发团队更新: 2026-08-07
1

核心命题:不是一个万能模型,而是一套会进化的研发系统

System Thesis

iterMix_brain 的关键认知,是把通用 LLM 与高精度专业模型明确分开。前者承担科学协调、模型改进和过程决策;后者承担细胞、蛋白、抗体及其他垂直任务的专业预测与生成。

LLM 是科学协调者和模型改进者;垂直专业模型是高精度执行引擎。系统价值来自二者在可验证闭环中的持续共同进化。
两类模型,各司其职 LLM coordinates scientific work · Domain models deliver precision 聚焦的生物医药生产目标 A LLM 协调模型 Scientific coordinator / model improver 科学定义 资源映射 策略组合 代码修改 失败诊断 下一轮决策 核心产物 TaskPackage StrategyPortfolio Intervention Diagnosis DecisionRecord Verified trace B 垂直专业模型 High-precision domain engines 细胞状态 扰动预测 因果靶点 结构复合物 抗体设计 属性与评分 核心产物 Prediction Generation Uncertainty Ranking ModelVersion PipelineArtifact Domain metrics 任务与调用 结果与证据 核心原则:协调模型不替代专业模型;它负责选择、改进、验证和组织专业模型
图 1 · 两类模型的职责分工。用任务契约向右传递目标,用结果与证据向左反馈决策。
边界: 通用 LLM 不直接冒充扰动预测器、结构预测器或亲和力模型;专业模型也不能自行修改评测协议或宣告认证成功。
2

战略双引擎:宏观编排与微观模型手术

Dual Engines

双引擎不是两个互相调用的聊天 Agent,而是两套不同时间尺度的决策机制:宏观引擎选择方向,微观引擎制造可执行证据。

双引擎协同:方向选择与局部模型手术 Macro orchestration chooses where to go · Micro improvement proves what works 1 宏观科学编排引擎 选择做什么、为什么、何时改变路线 1 Task Definition 科学问题、成功标准与边界 2 Resource Mapping 知识、数据、模型、工具与实验资源 3 Strategy Portfolio 保留不同机制假设与方法路线 4 Scientific Critic 检查证据、风险、缺口与反例 5 Decision Policy 继续、分支、转向、认证或停止 2 微观模型优化引擎 把假设变成可执行修改,并用结果筛选 1 Intervention Generator 提出数据、特征、目标与架构修改 2 Search Controller 管理候选、多样性、预算与停止条件 3 Patch / Config Builder 生成可运行代码、配置与 pipeline 4 Experiment Scheduler 执行训练、推理、工具与消融实验 5 Diagnosis 定位代码、数据、指标或科学假设失败 接口契约 Task Strategy Intervention Evidence Decision 共同目标 在受控预算与隔离评测下,让专业任务产生可复现、可解释、可认证的提升
图 2 · 双引擎通过版本化契约交接任务、策略、intervention、证据和决策,避免职责混杂。

宏观问题

科学问题是否定义正确?资源是否完整?应继续局部搜索、改变路线,还是进入湿实验?

微观问题

哪项代码、数据、表示、目标函数或训练改动,在给定预算内最可能产生可信提升?

共同验收: 不是“生成了多少方案”,而是在受控预算和隔离评测下,是否获得可重放、可归因、可认证的任务提升。
3

分层系统架构:主流程、资源侧栏与治理侧栏

Layered Architecture

总体架构采用一条清晰的纵向主流程,资源注册和治理能力作为两条侧栏接入。Task plugin 通过稳定 contracts 贯穿各层,而不是为每种生物任务复制一套 Brain。

iterMix_brain 分层系统架构 Clear responsibilities · Stable contracts · Independent evaluation R 资源注册层 Knowledge Datasets Models Tools Benchmarks 版本 · 来源 · 许可 能力边界 · 成本 泄漏风险 · 适用任务 G 治理侧栏 Access control Human gates Audit trail Budget policy Safety / IP 认证隔离 权限最小化 决策可追溯 01 接口与任务接入 Human owner CLI / API Task readiness 02 宏观科学编排 Task definition Resource mapping Strategy portfolio Scientific critic Decision policy 03 微观模型优化 Intervention Search controller Patching Scheduler Diagnosis 04 执行与专业模型 Sandbox runtime Compute backend Task pipeline Domain models Artifacts 05 独立评测与认证 Discovery Validation Certification Production 06 证据、记忆与训练数据 Experiment ledger Lineage Reviewed lessons Trace factory 学习反馈出口 经审核证据 → 更新 Layer 02 的策略组合、决策规则与资源优先级 Task plugins 通过 contracts 接入全部层级;不为每个任务复制一套 Brain
图 3 · 六层主流程 + 两条共享侧栏。主方向从任务接入流向证据沉淀,经审核的经验只通过底部学习反馈出口回到宏观策略。
架构区回答的问题不可越过的边界
Macro做什么、为什么、何时转向不能静默改变历史任务版本
Micro具体改什么、怎样搜索不能访问锁定认证答案
Runtime怎样可靠执行和重放不负责判断科学价值
Evaluation结果是否真的更好独立于候选生成与执行
Memory / Training什么经验可以复用或训练不能把聊天总结直接当训练事实
4

微观模型优化闭环:在固定专业任务内完成可验证迭代

Micro Improvement Loop

本图只描述冻结 TaskPackage 之后的任务内优化。每次状态变化由 DecisionRecord 驱动;继续局部搜索时进入下一项 intervention,触发停止、转向或认证条件时返回宏观科学编排引擎。

微观模型优化闭环 Frozen task contract · Local interventions · Independent evaluation · Evidence back to macro strategy 1 锁定任务版本 TaskPackage / split 指标、预算与边界 2 复现 Baseline 代码与环境 数据与指标 3 生成 Intervention 假设与修改 预期收益风险 4 执行实验 Sandbox / GPU 日志与 artifacts 5 分层评测 指标与不确定性 泄漏检查 6 证据决策 继续 / 分支 认证 / 停止 评测权限逐级收紧 Discovery 高频 · 快速淘汰 搜索可读诊断 Validation 中频 · 选择与消融 限制查询预算 Certification 低频 · 真实泛化 隔离执行 + 人类 gate Production 按需 · 研发价值 湿实验 / 风险 / 成本 任务内继续 DecisionRecord → 同一 TaskPackage 内选择下一项 Intervention 失败 run → 进入 ledger,并参与后续诊断 宏观出口 停止 / 转向 / 认证条件触发 返回宏观科学编排引擎 每一轮必须可重放:Task + Code + Environment + Data + Model + Evaluator 全部版本化
图 4 · 固定专业任务内部的微观优化闭环。左侧分支继续局部模型改进,右侧分支在边界条件触发后返回宏观科学编排。

核心数据契约

Task & Baseline

任务、数据、代码、环境、模型和 evaluator 均形成冻结 snapshot。

Intervention & Run

每项改动带假设、父节点、成本、风险、patch 和完整运行记录。

Evaluation & Decision

独立 evaluator 产生签名结果,DecisionRecord 决定继续、转向或停止。

禁止: 反复查看 certification set、删除失败实验、由候选生成 Agent 修改 evaluator,或只报告最佳一次结果。
5

证据与双飞轮:共享事实,不混合训练目标

Evidence & Learning

同一套执行和评测证据可以同时服务协调模型与专业模型进化,但两类数据的语义、格式、泄漏风险和成功指标完全不同。

同一证据底座,驱动两条学习飞轮 Verified evidence is shared · Training data and success metrics stay separate 1 Raw runs 成功、失败 日志与成本 2 Evidence check 执行验证 泄漏检查 3 Reviewed lesson 因果归因 适用边界 证据晋级 human review dataset versioning A 协调模型飞轮 任务拆解 · 工具调用 · 失败诊断 决策轨迹 -> verified coordinator traces 目标:更强的科学编排与模型改进能力 B 专业模型飞轮 Omics · Sequence · Structure · Assay 数据与标签 -> DomainModelVersion 目标:更高精度、泛化与实验成功率 四类存储严格分开 Artifact Store 代码、模型、图表、日志 Experiment Ledger 不可变 run、评测与决策事实 Scientific Memory 审核后的规律与失败边界 Training Dataset 许可、去泄漏、版本化样本 不可混淆 协调模型变强、搜索预算增加、专业模型进步必须分别归因和报告
图 5 · 原始轨迹经过执行验证、科学审核和数据版本化后,才分别进入协调模型与专业模型的学习通道。
必须分别报告
Coordinator gain
任务定义、工具使用、诊断、决策与跨任务迁移
Domain gain
专业指标、OOD 泛化、校准、成本与湿实验成功率
归因纪律: 更强基础 LLM、更多搜索预算、更多训练数据和专业模型本身的改进不能混成一个总分。
6

Phase 0-4:先证明微观能力,再扩展完整科学过程

Roadmap

每个阶段都保留一个可运行 vertical slice。近期不建设大而全的平台,先完成一个任务从 baseline、intervention、执行、验证到认证的可信闭环。

Phase 0-4:从可信微观闭环到完整 DBTL Every phase keeps one executable vertical slice alive P0 锁定基础 主要建设 Contracts Baseline snapshot Split policy 退出:baseline 可复现 P1 微观引擎 主要建设 Intervention Search + runner Evaluation + lineage 退出:完成一次认证 P2 宏观引擎 主要建设 Task definition Strategy portfolio Scientific critic 退出:可转向与停止 P3 协调模型进化 主要建设 Trace curation Task generator SFT / RL data 退出:held-out 超越 P4 完整 DBTL 主要建设 Assay planning Wet-lab feedback Cross-round learning 退出:Test 改变 Design 近期主战场:Phase 0 + Phase 1,先证明“系统能让一个专业模型真的变好”
图 6 · 分阶段建设与退出条件。Phase 0-1 是当前主战场,后续能力必须建立在真实轨迹之上。
做:单任务闭环做:独立 evaluator做:失败与成本记录不做:先造大平台不做:先训大模型
7

明日会议需要形成的四个决策

Meeting Decisions

架构已经能指导行动,会议重点应从“还能画什么模块”转向“首个 vertical slice 如何冻结”。

近期唯一关键交付:一个能复现 baseline、执行 intervention、隔离评测、记录谱系,并可信回答“是否真的变好”的单任务最小系统。
内容来源:IterMix_Brain_Strategy.mdLayered_Development_Architecture.md。本页用于会议展示,不替代两份持续演化的源文档。