芯东西(公众号:aichip001) 作者 陈骏达 编辑 漠影 中国AI芯片的军备竞赛,正在提速。9月22日,2026杭州云栖大会开幕当天,平头哥发布了新一代训推一体AI芯片真武V900,性能达到上一代真武M890的3倍,成为目前性能最强的中国自研AI芯片之一,计划于2027年第一季度量产。 但一个现实的挑战也随即出现:芯片造出来了,生态能不能跟上,才是它能否真正进入生产环境的关键。 就在大会第二天,平头哥公布了开源AI软件栈T-Head SAIL(以下简称“SAIL”)的最新进展,并宣布进一步扩大在框架适配、加速库、工具链、通信库等领域的开源力度。 平头哥正在做的,是把此前在真实生产环境中打磨的软件能力,进一步向全球开发者开放。 过去主要服务于头部客户的能力,开始进入更开放的开发者生态。 一、AI芯片,为什么越来越离不开软件栈? 如果把AI芯片比作发动机,软件栈就是变速箱、传动系统和驾驶系统。发动机再强,如果没有一整套传动和控制系统把动力有效传到车轮上,车是跑不起来的。 芯片提供的是原始算力,而开发者写的是PyTorch、TensorFlow这些上层框架, 芯片与上层应用之间,必须有一整套软件栈来完成“翻译”和优化的工作,将其转换为芯片能听懂、能高效执行的指令。 所以真正决定开发体验和芯片最终效果的,不只是峰值算力,还有软件栈的成熟度,模型迁移难不难、主流框架支持全不全、算子性能强不强等等维度。 而这恰恰是中国自研AI芯片的一个集体痛点。 全球AI开发者生态长期围绕海外主流生态建立,过去十几年,大量代码、模型、调优经验和开发者习惯都沉淀在这套体系里。 中国AI芯片作为后来者,硬件性能可以快步追赶,软件生态的积累却无法一蹴而就。自家的软件栈更年轻,适配过的模型、框架、算子更少,而开发者手里既有的资产和经验,大多难以直接派上用场,遇到问题只能排队等厂商响应,迁移一个项目动辄数周。 这道难题面前,行业里大致有两种思路。 一种是厂商自己搞: 一点点补齐模型、框架和算子适配,靠自家研发力量把生态建起来。 这条路并非走不通,但随着AI技术迭代越来越快、应用场景越来越分散,单靠一家公司的研发力量,想要全部覆盖正变得越来越吃力。 另一种思路是开放: 把底层能力交出来,让开发者、科研机构和产业伙伴一起把生态“长”出来。 平头哥选择的是后者。平头哥半导体软件生态资深总监陆生华介绍,真武系列硬件的用户量已经较大,生态本身对开源开放也有了迫切需要,以进行二次开发。SAIL相关的的开源代码已公开到GitHub上,未来,基于GitHub的开发分支将会作为研发的主线。 开源后,开发者可以直接读源码,看懂芯片底层运行逻辑,遇到bug能直接定位甚至修复。 企业还能根据自己的细分业务场景做深度定制优化,这是过去平头哥很难涉足的领域。 这些优化经验也会反哺社区,最终激发出开发者生态的活力。 二、从驱动到工具链,把真武”整套软件底座”打开 T-Head SAIL是平头哥面向真武AI芯片打造的底层软件栈,拥有自主知识产权,全面兼容主流AI生态。它覆盖从OS层、SDK层到接口层的完整链路,向下释放真武硬件算力,向上承接上层应用需求。 这套软件栈由五层技术栈组成,环环相扣。 最底层是Driver与Runtime :PPU Driver分为内核态的KMD与用户态的UMD,配合PPU Runtime提供统一的设备管理和内存管理接口,让操作系统真正理解这颗芯片。 在此之上, 编程语言层 完整支持C/C++与Python,开发者无需学习新的语言或编程范式,现有代码资产可以平滑迁移。 再往上是 编译器层 ,Compiler与Debugger两大组件构成完整的开发闭环,把上层框架的代码翻译并优化成芯片指令。 高性能库层 则起到了把硬件算力“封装”成现成性能的作用。SAIL提供了六大核心数学库为大模型训练与推理提供支撑,也有四个编解码库用户满足多模态数据处理的高吞吐需求,还有专为多卡、多机分布式训练而设计的集合通信库,此外acext扩展库与HGML机器学习库则进一步拓展了功能边界。 而在最贴近日常开发的 工具层 ,SAIL也提供了多种工具。Asight Compute支持算子级精细性能分析,帮助定位微观瓶颈;Asight Systems面向系统级全栈Profiling,提供宏观视角;PPU-SMI实现设备实时监控与管理;PPU-DCGM支撑集群级别的资源智能调度。 除了SDK的开放,截止今年9月,平头哥目前已开源39个和真武硬件低精度特性对齐的量化模型,累计下载超34.8万次。 从单卡调试到千卡运维,五层结构看下来,SAIL的三个特点其实是一脉相承的。 首先是兼容性。 SAIL已全面适配PyTorch、TensorFlow、vLLM、SGLang等260余个主流训练与推理框架,主流模