摘要
9 月 13 日,上海 AI 实验室在浦江创新论坛"人工智能赋能科学研究"专题论坛上发布开源基础大模型"书生-S2"。该模型重点提升长程科研能力与智能体能力,通过创新架构设计支持科学专业知识的持续扩展;在知识、代码、智能体等通用能力上进入开源第一梯队,并在 Biology-Instructions、Mol-Instructions 等生命科学与材料结构任务上大幅领先其他开闭源旗舰。配套升级的书生·端砚科学发现平台同步开放全栈服务,物理世界模型 W0、上海同步辐射光源等大科学装置接入,标志着 AI for Science 从"单任务工具"走向"可持续、可核验、可复现"的完整科研闭环。
一句话结论:书生-S2 的看点不是又一个"全能旗舰",而是把大模型、实验平台和大科学装置串成了"方案推演 → 实验设计 → 运行控制 → 数据分析"的完整链路——这是国内 AI for Science 第一次以体系化形态亮相。
1. 书生-S2 是什么:为科研而生的多模态基座
1.1 三大核心定位
| 能力维度 | 具体内容 | 工程意义 |
|---|---|---|
| 长程科研能力 | 支撑实验设计、运行控制、数据分析等数天至数周跨度的科研任务 | 科研任务不是"一次问答",而是长链路、多步骤、带状态的工作流 |
| 智能体能力 | 模型与 Science Harness 协同,工具调用、环境交互 | 科研 Agent 需要调用计算软件、实验设备 API 与数据库 |
| 科学知识持续扩展 | 创新架构设计探索科学专业知识的持续注入与更新 | 科学前沿日新月异,模型必须支持低成本的知识扩展而非全量重训 |
1.2 基准表现:通用不掉队,科学大幅领先
- 通用能力:在知识、代码、智能体等通用评测上达到开源模型第一梯队——没有为了科学场景牺牲通用性;
- 科学任务:在 Biology-Instructions(生物学指令)、Mol-Instructions(分子指令)等生命科学和材料结构理解、生成与设计相关的科学任务评测上表现优异,大幅领先其他开闭源旗舰模型;
- 算力底座:与昇腾计算生态深度协同,围绕计算、通信、显存进行深度优化,探索从模型能力提升到国产算力基础设施优化的协同演进路径。
1.3 为什么"长程"是科研大模型的关键词
通用对话模型的评估窗口是"一轮问答"(秒级),而真实科研任务的周期是:
- 方案推演(小时级):文献调研、假设生成、实验方案设计;
- 实验执行(天级):设备参数设置、运行控制、中途异常处理;
- 数据分析(天级):谱图解析、结果统计、与假设比对;
- 迭代闭环(周级):修正假设、进入下一轮。
传统大模型在前两步就会暴露问题:上下文撑不满长周期任务的状态,工具调用的可靠性在数十步之后断崖下降,且无法对"自己上一步做了什么"保持可核验的记忆。书生-S2 把"长程科研 + 智能体"作为第一优先级,正是针对这个断点。
2. 书生·端砚:从模型到科研操作系统的升级
2.1 端砚平台的三大核心升级
书生·端砚科学发现平台于今年 7 月首发,本次同步升级并全面开放全栈服务:
| 升级点 | 内容 | 解决的问题 |
|---|---|---|
| 模型与 Science Harness 协同 | 面向复杂科研任务,模型通过标准化 Harness 接口调用计算与实验资源 | 避免每个科研团队重复造 Agent 轮子 |
| 可信科研证据链 | 贯穿科研全程的证据记录,每一步推理与操作可追溯 | AI 参与科研最大的质疑:“结论是怎么来的” |
| 连接真实科学验证闭环 | 与真实实验设备、大科学装置对接,方案可被真实世界检验 | 从"模拟推演"到"真做实验" |
2.2 书生物理世界模型 W0:数字化能力进入物理世界
端砚平台同时接入书生物理世界模型 W0,其两个创新点值得注意:
- 原生力触(force-touch):直接建模力学交互信号,而非仅从视觉推断裂学属性——这对机械臂操作实验设备、材料加载测试等场景是刚需;
- 双工协同:感知与行动并发进行,而非"感知-规划-执行"的串行流水线,缩短物理世界的响应延迟。
W0 的定位是"为大模型的数字化能力进入物理世界提供关键支撑,为科学智能从方案推演走向真实实验打开路径"。
2.3 大科学装置接入:闭环的最后一块拼图
论坛上,上海 AI 实验室联合四家机构,把自主科研闭环延伸至大科学装置与中试平台:
| 合作机构 | 类型 | 在闭环中的角色 |
|---|---|---|
| 上海同步辐射光源(SSRF) | 大科学装置 | 提供常规条件难以企及的实验条件与精密探测能力 |
| 中国散裂中子源(CSNS) | 大科学装置 | 材料微观结构表征 |
| 原子制造大装置 | 大科学装置 | 原子级制造工艺验证 |
| 电合成新技术研究所 | 中试平台 | 概念验证与中试放大,推动成果走向产业 |
科研人员可借助大科学装置的独特实验条件探究常规条件难以揭示的科学机理;通过中试平台开展概念验证与中试放大;端砚则以 AI 赋能方案研究、实验设计、运行控制与数据分析,服务装置与平台的智能化升级。
3. 工程师视角:Science Harness 长什么样
3.1 一个科研 Agent 工作流的配置示意
# science_harness_task.yaml — 端砚平台科研任务配置(示意)task:name:"钙钛矿电池组分优化"objective:"最大化光电转换效率,约束铅含量 < 1.2 mg/cm2"model:"intern-s2"# 书生-S2 作为推理引擎max_horizon:"14d"# 长程任务上限evidence_chain:true# 全程证据链(可核验)steps:literature:tools:["paper_search","patent_db"]hypothesis:mode:"bayesian_optimization"# 组分空间探索budget:120# 候选配方上限simulation:tools:["dft_lite","molecular_dynamics"]fallback:"surrogate_model"# 算力不足时切换代理模型wet_lab:device:"robotic_station_03"# 自动化实验站w0_bridge:# W0 物理世界模型桥接force_touch:trueduplex:truesynthesis:facility:"ssrf_beamline_08u"# 上海光源线站booking:"auto"guardrails:human_approval:-"wet_lab.hazardous_reagents"# 危险试剂需人工确认-"facility.booking > 8h"# 长时装置占用需审批stop_gate:metric:"efficiency_improvement"patience:3# 连续 3 轮无提升自动收敛这份配置里体现了三个设计原则:证据链全程开启(对应"可核验")、危险操作强制人工审批(对应"可信")、停止条件显式定义(对应"可持续"——与智谱 RSI 的 stop_gate 异曲同工,长程自主系统的第一工程问题都是"怎么优雅地停")。
3.2 分子任务调用的 Python 示意
# mol_task.py — 书生-S2 分子生成任务调用示意fromintern_s2importScienceClient# 示意 SDKclient=ScienceClient(model="intern-s2",backend="ascend")# 昇腾后端resp=client.generate(task="mol-design",instruction=("设计 3 个候选小分子:靶点 SARS-CoV-2 主蛋白酶,""要求 QED > 0.6,合成可及性 SA score < 4.5,""输出 SMILES 与逐条性质预估,并给出推理证据链。"),constraints={"qed_min":0.6,"sa_score_max":4.5,"exclude_substructures":["reactive_toxicophores"],},evidence=True,# 返回检索/计算证据,供人工复核)forcandinresp.candidates:print(cand.smiles,cand.properties,cand.evidence_ref)evidence=True返回的证据引用(evidence_ref)可以直接对接端砚的证据链模块——模型输出的每一条性质预估都能追溯到具体的文献、计算任务或实验数据,这是科学场景与通用生成场景在工程上最大的差异:答案不重要,答案的可追溯性才重要。
4. 行业坐标:AI for Science 的三种路线
| 路线 | 代表 | 特点 | 局限 |
|---|---|---|---|
| 专用科学模型 | AlphaFold 系列等 | 单一任务精度极高 | 任务迁移成本高,难以覆盖长链路科研 |
| 通用模型 + 科学提示 | 通用旗舰模型的科学问答 | 零部署成本 | 无工具闭环、无证据链、长程能力弱 |
| 基座 + 平台 + 装置一体化 | 书生-S2 + 端砚 + 大科学装置 | 长程 Agent、证据链、真实实验验证 | 体系重、依赖算力与装置资源 |
第三种路线的门槛在于"一体化":既要有科学能力足够的开源基座,又要有能调度计算与实验资源的平台层,还要有真实装置愿意接入。三者集齐后,AI for Science 才能从论文里的 demo 变成实验室里的日常工具——这也是书生-S2 发布最值得记录的行业信号。
5. FAQ
Q1:书生-S2 开源吗?
A:官方口径为"开源基础大模型",发布时宣布在通用能力上达到开源模型第一梯队。具体权重开放范围与许可证建议关注上海 AI 实验室官方渠道的最新说明。
Q2:书生-S2 与 InternLM/书生系列此前模型是什么关系?
A:书生-S2 是书生多模态大模型系列的最新版本,重点从通用对话能力转向长程科研与智能体能力,并通过创新架构探索科学知识的持续扩展。
Q3:Biology-Instructions、Mol-Instructions 是什么基准?
A:两者是生命科学与分子科学领域的指令化评测集,覆盖分子性质预测、分子生成、反应预测、蛋白质理解等任务,常用于衡量模型在真实科研语义下的科学能力。
Q4:端砚平台普通科研团队能用吗?
A:本次升级后端砚"全面开放全栈服务",科研团队可申请接入。大科学装置资源(如上海光源线站)的调度则涉及机构合作与机时审批,不是完全开放式的。
Q5:W0 物理世界模型和大视频生成模型有什么区别?
A:视频生成模型优化的是"画面像不像",W0 优化的是"物理交互对不对"——原生力触信号建模与双工协同,目标是让机器人在真实实验环境中可靠地操作设备,而不是生成好看的演示视频。
Q6:这和智谱押注 RSI、Anthropic 提议 RSI 速度上限有什么关系?
A:三者代表了当前大模型的三个前沿方向:智谱在资本层面押注"AI 训练 AI"的自进化闭环;书生-S2/端砚在应用层构建"AI 做科研"的真实世界闭环;Anthropic 则在治理层讨论给自主迭代设上限。共同点都指向同一个判断——下一阶段的大模型竞争在"闭环能力",而不在单轮问答跑分。
参考资料
- 人民网:《开源基础大模型"书生-S2"发布》,2026-09-14
- 上海人工智能实验室:书生·端砚科学发现平台全栈服务开放公告,2026-09-13
- 浦江创新论坛(第十九届)"人工智能赋能科学研究"专题论坛议程,2026-09-13
- SegmentFault:《AI 日报(2026 年 9 月 14 日)》——智谱融资与治理动向专题,2026-09-14
- AITOP100:《每日 AI 资讯 2026 年 9 月 14 日》——DeepSeek V4.1 Flash 上线千问平台、蚂蚁 Ling 3.0 矩阵等,2026-09-14