阶段目标:完成 Agent、知识数据、科学评测和计算执行骨架;以 Multimodal Cell Maps 为第一案例,把细胞方向确定为首条自研能力主线。
AI Scientist 研发组织与人员路线
建立 Agent、数据、评测与细胞方向最小骨架。
完成回顾性校准,并跑通第一条细胞科研闭环。
在门槛通过后扩展细胞、蛋白与物理模拟能力。
以上人数包含 Scientific Product Lead;若该角色由创始人承担,应从新增招聘数中减去 1。全部人数为 [猜测],不是行业统计结论。
结论:不是一个 Agent 团队,而是一套科研操作系统
项目的人员结构必须同时覆盖四种不可互相替代的工作:科学决策、Agent 运行体系、知识与数据工程、自研科学算法。只配置“科学家 + 通用软件工程师”,会把 Agent 基础设施和能力验证变成无人负责的公共问题。
AI 可以显著放大的部分
并行检索、代码实现、数据处理、工具封装、测试、文档、候选方案展开与重复运行。
不能因此取消的人类责任
证据定级、因果判断、实验有效性、能力边界、gold annotation、争议裁决和最终路线决策。
为什么 AI 支持下仍需要专业团队
当前 agent 产品已经支持长任务、并行线程、技能封装和人工审阅,因此一名资深员工可以监督更多执行工作。(OpenAI, 2026a)
Agent-first 工程案例显示,工具、抽象、可观测性、知识结构和反馈回路不足时,Agent 仍难以可靠工作。(Lopopolo, 2026)
一项针对成熟开源仓库的随机实验发现,特定早期 2025 AI 工具在该场景使资深开发者平均变慢 19%;结果不能外推到本项目,但足以否定“统一效率倍数”的假设。(Becker et al., 2025)
当前项目路线要求独立标注、争议裁决、领域审查和遮蔽评测;答案生成者不能同时成为唯一评分者。(HARNESS_V0; ROADMAP)
组织运行模型:横向操作系统支撑纵向科学能力
细胞、蛋白和物理模拟团队不是普通“工具供应商”。它们拥有算法、数据、benchmark 和失效边界;Agent 平台将这些能力组织成可被科学大脑选择和审计的行动空间。
岗位职责:每个角色守住一个不可让渡的边界
奠基期:0–6 个月,6–8 人
| 岗位 | 人数 | 本阶段主要交付 |
|---|---|---|
| Scientific Product Lead | 1 | 冻结第一阶段科学问题、证据标准、决策对象与不做事项。 |
| Agent Systems Engineer | 1 | 统一 run schema、tool contract、trace、人工审核、权限与可恢复执行。 |
| AI / Evaluation Engineer | 1 | 把 Paper-to-Decision-Trace 变成可重复评测;建立模型与 prompt 回归。 |
| Scientific Data / Knowledge Engineer | 1 | 文献、图表、补充材料和数据集的溯源、标准化与版本管理。 |
| Platform / Scientific Computing Engineer | 1 | 开发环境、任务执行、容器、日志、计算资源和内部审阅界面。 |
| Computational Cell Scientist | 1 | 拆解细胞案例,定义计算路线、实验能力和 Scientific Capability Contract。 |
| Cell ML / Experimental Scientist | 0–2 | 根据现有成员能力补齐模型研发或实验审查;也可先以顾问形式参与。 |
闭环期:6–12 个月,8–10 人
阶段目标:完成 M2 回顾性校准并启动一个窄问题的 shadow mode;细胞团队交付第一批可被 Agent 理解、调用和评价的自研计算能力。
新增或强化岗位
| 岗位变化 | 建议人数 | 职责增量 |
|---|---|---|
| Cell Intelligence Pod | 扩至 3–4 | 形成 pod lead、算法/ML、计算生物和实验/转化审查的组合;维护模型 benchmark 与边界。 |
| Independent Evaluation / Statistics | 0.5–1 | 从兼职顾问逐步转为稳定责任,主持盲评、校准和分歧分析。 |
| Product / Review Workflow | 0–1 | 当内部审阅、任务比较和 run 管理开始占用平台工程时间时拆出。 |
| Protein / Physics Scouts | 兼职 | 定义未来能力合同和首批用例,不提前扩成完整部门。 |
进入中期扩展前必须看到的信号
- 评测有效:blind harness 能区分没有依据的流畅回答与真正有用的行动建议。
- 责任可审计:任一建议都能追溯到证据、模型、工具、版本、人工修改与最终审批。
- 能力被真实选择:Agent 不只是调用细胞模型,而是能说明为何在当前不确定性下选择它。
- 反馈能改变状态:真实计算或实验观察会触发 advance、revise、hold 或 stop,而不是只增加报告长度。
扩展期:12–30 个月,17–22 人
阶段目标:在第一条闭环通过门槛后,把蛋白和物理模拟发展为独立能力团队;运行 3–5 个真实科研项目,并让能力缺口反向驱动模型与数据研发。
| 团队 | 人数 [猜测] | 职责 |
|---|---|---|
| 科学产品与研究治理 | 1–2 | 组合项目选择、科学标准、投资优先级和外部科研合作。 |
| Agent Platform | 2 | 一人负责 runtime、协议和可靠性;一人负责科研 workflow、context 与能力融合。 |
| Knowledge / Data Platform | 2 | 论文和数据产品、知识表示、数据治理、版本与持续质量。 |
| Evaluation / Causal / Statistics | 1–2 | 独立 benchmark、校准、因果与实验设计审查、跨项目失败分析。 |
| Product / Scientific Infrastructure | 2 | 产品界面、平台、HPC、部署、成本、权限和观测。 |
| Cell Intelligence Pod | 3–4 | 细胞表征、多模态、扰动预测、表型与功能验证。 |
| Protein Intelligence Pod | 3–4 | 结构、相互作用、功能、设计、打分及其适用边界。 |
| Physics and Simulation Pod | 3–4 | 动力学、多尺度模拟、自由能与物理约束模型。 |
| Research Operations | 1 | 外部实验、CRO、样本、交付、数据回流和合作节奏。 |
招聘顺序:围绕瓶颈扩编,而不是一次配齐组织图
建议招聘顺序
| 优先级 | 岗位 | 何时招聘 | 不招聘的直接后果 |
|---|---|---|---|
| 01 | Agent Systems Engineer | 项目启动即到位 | 工作流碎片化,其他专业人员难以稳定获得 Agent 杠杆。 |
| 02 | Scientific Data / Knowledge Engineer | 与 Agent 工程师同期 | 来源、版本和实体标准缺失,决策 trace 无法可靠复现。 |
| 03 | AI / Evaluation Engineer | 首批模型输出产生前 | 系统只能展示答案,不能知道何时进步或退化。 |
| 04 | Cell Capability Lead | 第一案例冻结后 | 能力层停留在外部工具调用,无法形成自研科学壁垒。 |
| 05 | Platform / Scientific Computing | 运行与部署开始挤占算法时间时 | 算法人员被基础设施拖住,计算结果难以重复。 |
| 06 | Protein / Physics Pod | 闭环验证且真实需求重复出现后 | 过早招聘会让三个方向各自优化,失去共同 AI Scientist 核心。 |
依据、假设与需要重新校准的变量
外部依据
- OpenAI (2026a). Introducing the Codex app. 用于支持多 Agent 并行监督、skills 和可复用工作流的能力描述。本地证据笔记:
references/openai_2026_codex_app_evidence_note.md。边界:厂商产品说明,不是独立生产率研究。 - Lopopolo, R. (2026). Harness engineering: leveraging Codex in an agent-first world. 用于支持环境设计、反馈回路、可观测性和 agent-legible knowledge 的必要性。本地证据笔记:
references/openai_2026_harness_engineering_evidence_note.md。边界:单个软件团队案例,不能直接外推到生命科学。 - Becker, J., Rush, N., Barnes, E., and Rein, D. (2025). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089。本地 PDF:
references/metr_2025_developer_productivity.pdf。边界:特定工具、资深开发者与成熟仓库,不代表本项目预期效果。
项目内部依据
| 项目文件 | 支持的组织结论 | 事实边界 |
|---|---|---|
README.md | 项目同时需要证据审计、下一步行动推荐和多步策略模拟。 | 这是当前项目定义,不是已验证产品能力。 |
docs/project/ROADMAP.md | 人员增长应绑定 M1 标注质量、M2 回顾性校准和 M3 前瞻原型。 | 路线是项目设计选择,可随证据调整。 |
docs/methodology/HARNESS_V0.md | 独立标注、adjudication、领域和统计审查需要明确的人类责任。 | 流程尚需通过真实跨论文工作量校准。 |
ai_scientist_2026_strategy.html | 科研经验层与科研能力层共同支撑科学大脑,真实反馈反向增强两者。 | 这是目标架构,不等于当前已经实现。 |
人数需要根据哪些观测重新计算
工作量变量
每篇论文独立重建工时、争议率、工具接入周期、模型训练周期、HPC 成本和真实项目并发数。
质量变量
错误发现率、人工修改率、跨评审一致性、校准误差、工具失败率和结果对决策的实际改变比例。