ORGANIZATION DESIGN · INTERNAL STRATEGY

AI Scientist 研发组织与人员路线

科学大脑、知识与数据、Agent 基础设施和自研科学能力共同构成研发体系;人员增长由验证门驱动,而不是由愿景驱动。
版本 v1.0 规划周期 0–30 个月 更新 2026-08-19 人数均为规划假设
奠基期 · 0–6 个月6–8 人

建立 Agent、数据、评测与细胞方向最小骨架。

闭环期 · 6–12 个月8–10 人

完成回顾性校准,并跑通第一条细胞科研闭环。

扩展期 · 12–30 个月17–22 人

在门槛通过后扩展细胞、蛋白与物理模拟能力。

以上人数包含 Scientific Product Lead;若该角色由创始人承担,应从新增招聘数中减去 1。全部人数为 [猜测],不是行业统计结论。

1

结论:不是一个 Agent 团队,而是一套科研操作系统

项目的人员结构必须同时覆盖四种不可互相替代的工作:科学决策、Agent 运行体系、知识与数据工程、自研科学算法。只配置“科学家 + 通用软件工程师”,会把 Agent 基础设施和能力验证变成无人负责的公共问题。

推荐结构:一个横向科研操作系统,支撑三个逐步建立的纵向科学能力团队;独立评测负责阻止系统自我证明。

AI 可以显著放大的部分

并行检索、代码实现、数据处理、工具封装、测试、文档、候选方案展开与重复运行。

不能因此取消的人类责任

证据定级、因果判断、实验有效性、能力边界、gold annotation、争议裁决和最终路线决策。

规划边界:这里规划的是“决策系统 + 自研计算能力”,不包含自建完整湿实验平台。若中期自建湿实验能力,预计还需增加 5–8 人及相应设施投入。[猜测]
2

为什么 AI 支持下仍需要专业团队

并行 Agent 改变执行方式

当前 agent 产品已经支持长任务、并行线程、技能封装和人工审阅,因此一名资深员工可以监督更多执行工作。(OpenAI, 2026a)

杠杆来自环境,而非账号

Agent-first 工程案例显示,工具、抽象、可观测性、知识结构和反馈回路不足时,Agent 仍难以可靠工作。(Lopopolo, 2026)

不存在通用固定倍数

一项针对成熟开源仓库的随机实验发现,特定早期 2025 AI 工具在该场景使资深开发者平均变慢 19%;结果不能外推到本项目,但足以否定“统一效率倍数”的假设。(Becker et al., 2025)

科研评测要求职责分离

当前项目路线要求独立标注、争议裁决、领域审查和遮蔽评测;答案生成者不能同时成为唯一评分者。(HARNESS_V0; ROADMAP)

因此:专职 Agent Systems Engineer 是早期核心岗位。其职责是让科学家、算法工程师和数据工程师获得稳定的 Agent 杠杆,而不是替他们承担科学判断。
3

组织运行模型:横向操作系统支撑纵向科学能力

细胞、蛋白和物理模拟团队不是普通“工具供应商”。它们拥有算法、数据、benchmark 和失效边界;Agent 平台将这些能力组织成可被科学大脑选择和审计的行动空间。

一个系统,两类团队,持续反馈 科学问题定义和独立评测位于共同治理层 科学决策与评测治理 问题定义 · 证据标准 · 不确定性 · 行动排序 · 独立审查 · 推进 / 修订 / 暂停 / 停止 横向科研操作系统 Agent Systems 运行、工具协议、trace、权限、重试 Knowledge and Data 语料、溯源、数据产品、知识与版本 Scientific Computing 平台、HPC、部署、观测与复现 Cell Intelligence 细胞表征 · 多模态图谱 扰动预测 · 表型与因果 readout Protein Intelligence 结构与相互作用 · 功能预测 设计、打分、验证与模型边界 Physics and Simulation 分子动力学 · 多尺度模拟 自由能、动力学与物理约束 真实任务暴露能力缺口;新模型、数据和验证结果回写决策空间
图 1 · 横向团队建立共同运行环境,纵向团队创造高精度科学能力;双方通过真实科研任务共同演化。
关键接口:每个自研模型都要发布 Scientific Capability Contract,声明适用问题、输入输出、关键假设、验证集、校准、失败模式、计算成本,以及它能够减少哪一种不确定性。
4

岗位职责:每个角色守住一个不可让渡的边界

角色
人类必须负责
Agent 主要辅助
Scientific Product Lead
问题选择、路线边界、科学标准、优先级、资源与最终推进决定。
方案展开、决策记录、资料汇总、路线模拟和沟通材料。
Agent Systems Engineer
运行架构、工具协议、权限、安全、状态、trace、重试和团队工作模板。
生成适配代码、测试、文档、运行诊断和重复工作自动化。
AI / Evaluation Engineer
盲测设计、rubric、模型比较、校准、失败分类和回归门槛。
批量运行、评分候选、错误聚类和评测报告草稿。
Scientific Data / Knowledge Engineer
数据模型、来源策略、实体标准、版本、质量和可追溯性。
抽取、转换、映射建议、数据质量扫描和元数据补全。
Platform / Scientific Computing Engineer
计算环境、HPC、API、部署、可观测性、性能和可重复执行。
基础设施代码、容器、CI、性能排查和运行手册。
Capability Pod Lead
领域算法路线、benchmark、数据策略、科学有效性和能力边界。
文献与代码分析、实验矩阵、训练运行和模型诊断。
ML / Algorithm Scientist
模型假设、算法设计、训练评价、消融和失败解释。
代码实现、超参数实验、基线复现和结果整理。
Domain / Experimental Scientist
模型系统、对照、readout、因果解释、实验可行性和转化边界。
协议草案、文献比较、样本设计候选和检查清单。
Independent Reviewer
独立重建、质疑、争议保留和防止自我评分。
证据定位检查、差异报告和待裁决项整理。
不单设 Prompt Engineer:prompt、context 和 workflow 应成为科学家、Agent 工程师与评测工程师共同维护的版本化方法资产,而不是集中在一个脱离科学责任的岗位。
5

奠基期:0–6 个月,6–8 人

PHASE 16–8核心全职成员 [猜测]

阶段目标:完成 Agent、知识数据、科学评测和计算执行骨架;以 Multimodal Cell Maps 为第一案例,把细胞方向确定为首条自研能力主线。

岗位人数本阶段主要交付
Scientific Product Lead1冻结第一阶段科学问题、证据标准、决策对象与不做事项。
Agent Systems Engineer1统一 run schema、tool contract、trace、人工审核、权限与可恢复执行。
AI / Evaluation Engineer1把 Paper-to-Decision-Trace 变成可重复评测;建立模型与 prompt 回归。
Scientific Data / Knowledge Engineer1文献、图表、补充材料和数据集的溯源、标准化与版本管理。
Platform / Scientific Computing Engineer1开发环境、任务执行、容器、日志、计算资源和内部审阅界面。
Computational Cell Scientist1拆解细胞案例,定义计算路线、实验能力和 Scientific Capability Contract。
Cell ML / Experimental Scientist0–2根据现有成员能力补齐模型研发或实验审查;也可先以顾问形式参与。
共同工作台团队不再依赖每个人自己的 prompt 和本地脚本。
两个独立 packet满足当前 M1 的独立标注与争议裁决要求。
一个细胞能力地图明确已有能力、缺口、数据需求和验证路径。
本阶段不做:不同时建立完整蛋白与物理模拟团队;不以“接入工具数量”衡量进度;不将机器生成的 trace 当作已验证科学结果。
6

闭环期:6–12 个月,8–10 人

PHASE 28–10核心全职成员 [猜测]

阶段目标:完成 M2 回顾性校准并启动一个窄问题的 shadow mode;细胞团队交付第一批可被 Agent 理解、调用和评价的自研计算能力。

新增或强化岗位

岗位变化建议人数职责增量
Cell Intelligence Pod扩至 3–4形成 pod lead、算法/ML、计算生物和实验/转化审查的组合;维护模型 benchmark 与边界。
Independent Evaluation / Statistics0.5–1从兼职顾问逐步转为稳定责任,主持盲评、校准和分歧分析。
Product / Review Workflow0–1当内部审阅、任务比较和 run 管理开始占用平台工程时间时拆出。
Protein / Physics Scouts兼职定义未来能力合同和首批用例,不提前扩成完整部门。

进入中期扩展前必须看到的信号

  • 评测有效:blind harness 能区分没有依据的流畅回答与真正有用的行动建议。
  • 责任可审计:任一建议都能追溯到证据、模型、工具、版本、人工修改与最终审批。
  • 能力被真实选择:Agent 不只是调用细胞模型,而是能说明为何在当前不确定性下选择它。
  • 反馈能改变状态:真实计算或实验观察会触发 advance、revise、hold 或 stop,而不是只增加报告长度。
7

扩展期:12–30 个月,17–22 人

PHASE 317–22核心全职成员 [猜测]

阶段目标:在第一条闭环通过门槛后,把蛋白和物理模拟发展为独立能力团队;运行 3–5 个真实科研项目,并让能力缺口反向驱动模型与数据研发。

团队人数 [猜测]职责
科学产品与研究治理1–2组合项目选择、科学标准、投资优先级和外部科研合作。
Agent Platform2一人负责 runtime、协议和可靠性;一人负责科研 workflow、context 与能力融合。
Knowledge / Data Platform2论文和数据产品、知识表示、数据治理、版本与持续质量。
Evaluation / Causal / Statistics1–2独立 benchmark、校准、因果与实验设计审查、跨项目失败分析。
Product / Scientific Infrastructure2产品界面、平台、HPC、部署、成本、权限和观测。
Cell Intelligence Pod3–4细胞表征、多模态、扰动预测、表型与功能验证。
Protein Intelligence Pod3–4结构、相互作用、功能、设计、打分及其适用边界。
Physics and Simulation Pod3–4动力学、多尺度模拟、自由能与物理约束模型。
Research Operations1外部实验、CRO、样本、交付、数据回流和合作节奏。
Pod 的最小结构:通常由 1 名 capability lead、1–2 名算法/ML 科学家和 1 名领域或实验科学家组成;Scientific Computing 与 Agent Platform 尽量共享,避免三个方向重复建设基础设施。[猜测]
扩展风险:同时启动三个方向会把项目拆成三个独立 AI4Science 团队。只有当它们共享同一套能力合同、评测、数据治理和决策闭环时,才仍然是一个 AI Scientist 项目。
8

招聘顺序:围绕瓶颈扩编,而不是一次配齐组织图

从共同底座到三个科学能力 Pod 扩编条件写在箭头上:没有通过门槛,不进入下一阶段 1 先建立共同底座 Scientific Product Lead Agent Systems Evaluation Knowledge and Data Platform and Computing M1 / M2 可解释 2 做深第一条能力 Cell capability lead Cell ML scientist Computational biologist Experimental reviewer 交付首个连续反馈闭环 真实需求 重复出现 3 复制到新能力域 Protein Intelligence Pod Physics and Simulation Pod 复用共同合同、评测、数据 运行环境和决策闭环 招聘不是把传统岗位缩小,而是让每个人拥有明确判断责任,并用 Agent 扩大其执行半径
图 2 · 先构建共同底座,再做深细胞能力;蛋白和物理模拟的扩展由真实能力缺口触发。

建议招聘顺序

优先级岗位何时招聘不招聘的直接后果
01Agent Systems Engineer项目启动即到位工作流碎片化,其他专业人员难以稳定获得 Agent 杠杆。
02Scientific Data / Knowledge Engineer与 Agent 工程师同期来源、版本和实体标准缺失,决策 trace 无法可靠复现。
03AI / Evaluation Engineer首批模型输出产生前系统只能展示答案,不能知道何时进步或退化。
04Cell Capability Lead第一案例冻结后能力层停留在外部工具调用,无法形成自研科学壁垒。
05Platform / Scientific Computing运行与部署开始挤占算法时间时算法人员被基础设施拖住,计算结果难以重复。
06Protein / Physics Pod闭环验证且真实需求重复出现后过早招聘会让三个方向各自优化,失去共同 AI Scientist 核心。
9

依据、假设与需要重新校准的变量

外部依据

  1. OpenAI (2026a). Introducing the Codex app. 用于支持多 Agent 并行监督、skills 和可复用工作流的能力描述。本地证据笔记:references/openai_2026_codex_app_evidence_note.md。边界:厂商产品说明,不是独立生产率研究。
  2. Lopopolo, R. (2026). Harness engineering: leveraging Codex in an agent-first world. 用于支持环境设计、反馈回路、可观测性和 agent-legible knowledge 的必要性。本地证据笔记:references/openai_2026_harness_engineering_evidence_note.md。边界:单个软件团队案例,不能直接外推到生命科学。
  3. Becker, J., Rush, N., Barnes, E., and Rein, D. (2025). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089。本地 PDF:references/metr_2025_developer_productivity.pdf。边界:特定工具、资深开发者与成熟仓库,不代表本项目预期效果。

项目内部依据

项目文件支持的组织结论事实边界
README.md项目同时需要证据审计、下一步行动推荐和多步策略模拟。这是当前项目定义,不是已验证产品能力。
docs/project/ROADMAP.md人员增长应绑定 M1 标注质量、M2 回顾性校准和 M3 前瞻原型。路线是项目设计选择,可随证据调整。
docs/methodology/HARNESS_V0.md独立标注、adjudication、领域和统计审查需要明确的人类责任。流程尚需通过真实跨论文工作量校准。
ai_scientist_2026_strategy.html科研经验层与科研能力层共同支撑科学大脑,真实反馈反向增强两者。这是目标架构,不等于当前已经实现。

人数需要根据哪些观测重新计算

工作量变量

每篇论文独立重建工时、争议率、工具接入周期、模型训练周期、HPC 成本和真实项目并发数。

质量变量

错误发现率、人工修改率、跨评审一致性、校准误差、工具失败率和结果对决策的实际改变比例。

最终边界:6–8、8–10 和 17–22 人全部是当前范围下的组织设计假设 [猜测]。外部资料只支持“需要 Agent 基础设施、反馈回路和谨慎评估 AI 杠杆”,不直接支持这些具体人数。