机器之心发布 近期 2026 外滩大会上,北大助理教授杨灵关于「长程任务学习」的分享引发行业关注 ——当 AI 从单次问答走向长周期复杂任务,模型如何从持续交互中积累进化。而在这份分享的合作研究标识中,Muchen AI 的名字赫然在列。 紧随其后,PhAI Labs 发布交互式科研工作空间 ScienceBuddy,AItonomy Foundation 推出科研智能体开发环境 ScienceIDE,两份重磅发布的合作方名单中,沐晨科技(Muchen AI)均以联合研发与技术支持方的身份出现。 这家 2024 年才在重庆成立的 AI 数据工程公司,既不在互联网核心圈层,也并非模型厂商,为何能频频切入前沿科研与产业项目?它的增长逻辑,又折射出 AI 数据服务行业怎样的底层转向? 大模型下半场, 数据服务的核心早已不是「堆量」 大模型进入复杂任务落地阶段,数据服务的竞争核心早已从「样本量级」转向「过程质量」—— 任务边界是否清晰、评价标准是否统一、执行链路是否可追溯,正在成为比数据规模更关键的底层能力。 这正是沐晨科技从成立之初就锚定的方向:数据服务的交付物不只是样本本身,更包括让样本可用的任务定义、判断依据、质量记录与迭代机制。其中,结构化评价标准(Rubric)是整个体系的核心 —— 它把笼统的「回答得好不好」「结果对不对」,拆成可量化、可对齐、可检查的细分维度,比如事实准确性、逻辑完整性、约束符合度、错误严重等级等。 但写出评分表并不是终点。标准还要经过真实样本的双盲校验,解决不同人员的判断分歧;要跟随模型能力迭代更新版本,避免旧标准失效;还要和生产流程深度绑定,确保每一批交付都符合统一尺度。 这种模式下,数据生产不再是一锤子买卖,而是贯穿模型多轮迭代的长期运营工作。沐晨将其定义为Long-horizon AI Data Operations:面向复杂 AI 系统的长期数据工程与评测运营。 从交付样本到交付体系, 长周期工程能力的商业验证 理念的落地,最终要靠真实业务场景的打磨。 某头部代码大模型厂商在推进代码智能体工程化落地时,曾遭遇评测体系与真实开发场景脱节的核心瓶颈:传统评测多基于孤立算法题与简化 Demo,任务脱离真实工程环境,评分维度粗放,不同人员、不同模型的评测结果一致性偏差超 30%,无法有效支撑智能体真实工程能力的迭代。 沐晨没有采用「按需求生产样本」的传统交付模式,而是为客户搭建了一套从仓库筛选到结果溯源的全链路工程化评测体系:建立真实代码仓库质检标准,筛选具备完整业务逻辑与工程结构的项目仓库;构建统一可复现的 Docker 容器执行环境;设计覆盖 Bug 修复、功能开发、工程配置等真实开发场景的任务矩阵;配套分层级 Rubric 评价标准与全链路执行留痕机制。 所有任务均在 Trae 环境中完成 5 款主流代码模型的独立运行验证,完整保留执行链路、评分依据与 git diff 产物。最终评测人员一致性提升至 90% 以上,交付的可复用评测体系,持续支撑客户代码智能体的工程能力迭代与多版本优化。 对沐晨而言,单次项目验收不是终点,更重要的是建立跨多轮任务和模型迭代的持续交付能力。相比于传统数据公司「接项目、做交付、结项走人」的模式,这种长周期运营的门槛更高,但也构建了更深的客户粘性与业务壁垒。 成立两年间,沐晨已经将这套能力从通用大模型数据评测,延伸至多模态、智能体等多个场景。更关键的是,公司的增长并非依赖低价人力扩张,而是伴随着收入结构的持续优化:高价值的评测方案、长周期运营服务占比稳步提升,客户复购率与项目平均周期持续增长,走出了一条「质量优先」的增长路径。 走进科研场景, 把验证体系做进 AI 科研流程 如果说商业场景验证了沐晨的工程落地能力,那么参与 ScienceBuddy 的联合研发,则是这套能力向更前沿领域的延伸,也让「发现 — 拆解 — 验证 — 回流」的递归式科学任务闭环真正实现工程化落地。 科学研究对 “结果可信” 的要求远高于商业场景:一份科研分析是否可信,不能只看行文是否流畅;一段数值计算能否接受,也不能只看程序是否退出报错。方法、参考结果、单位、误差范围和实验条件,都会影响结论的有效性。 PhAI Labs 发布的 ScienceBuddy,关注科学家与 AI Agent 在真实研究中的持续交互,研究者提出问题、修正目标、评价结果,系统记录完整的工具调用与执行轨迹,为理解智能体表现提供依据。 在联合研发分工中,三大平台形成联动闭环: PhAI Labs 主导递归科学任务中台架构与整体产品交互框架设计,承担任务调度、状态管理与结果判定职能; 沐晨与 PhAI Labs 联合推进科学发现平台研发,负责科研问题采集、候选方案生成与待验证任务标准化输出; 科学验证平台的框架体系设计与工程