华东首个国产 TPU 千卡集群落地杭州,中昊芯英发布二代 AI 芯片“须臾”

2026年07月23日,23时21分19秒 科技新知 阅读 3 views 次

谷歌在 2016 年公开 TPU 时,外界对它的理解还很简单,这是一颗为了深度学习而生的专用芯片。彼时,AI 的主战场仍是训练,GPU 凭借通用性和成熟生态占据绝对优势。

十年后,大模型进入推理密集期,智能体反复调用模型,长上下文带来更重的输入负载,算力的衡量方式也更关注单位token的性价比。

这一变化正传导到国内市场。国产大模型快速迭代,DeepSeek、Qwen、GLM 等模型持续更新,国产芯片厂商也在寻找更具体的落点,芯片能否适配模型,集群能否稳定运行,调用成本能否被客户接受。

在 WAIC 期间,中昊芯英发布第二代自研 TPU 芯片“须臾”,并宣布华东地区首个国产 TPU 智算千卡集群在杭州落成。

华东首个国产 TPU 千卡集群落地杭州,中昊芯英发布二代 AI 芯片“须臾”

TPU 又被推到台前,原因是推理成本

大模型训练依然昂贵,但训练是一段相对集中的投入,推理则是一笔持续发生的成本账。

用户每一次与AI的交互,背后都在消耗 Token,智能体的出现进一步放大了这一过程。一项任务可能包含多轮检索、多次调用模型和连续生成,输入 Token 与输出 Token 的比例也可能相差很大。

中昊芯英创始人、CEO 杨龚轶凡提到,当前大模型推理正在走向 PD 分离,所谓 PD 分离,是将模型处理输入内容的 Prefill 阶段,与逐 Token 输出内容的 Decode 阶段拆开调度。前者需要快速处理大量上下文,后者更看重持续输出和低延迟。把两种任务放在同一套资源里运行,容易出现资源闲置或排队,拆开之后,集群可以围绕不同负载进行更细致的配置。

这也是 TPU 再次获得关注的原因。GPU 最初为图形渲染设计,后来凭借强大的并行计算能力成为 AI 训练的核心硬件,TPU 则从一开始就瞄准深度学习中的张量计算,它牺牲了一部分通用性,换取在特定任务中的计算密度和能效表现。谷歌将 TPU 用于自身数据中心和云服务,已经证明专用架构可以在大规模 AI 负载中找到位置。

国内的情况更复杂,GPU 生态长期占据主导,CUDA 工具链和开发习惯构成了很高的迁移门槛。国产 TPU 要进入市场,既要解决芯片本身的性能问题,也要回答开发者如何迁移、模型如何适配、客户如何调用的问题。

须臾是中昊芯英的第二代产品,据悉,这款芯片混合精度浮点算力达到 896TFLOPS,8-bit 推理算力达到 1792TOPS,整体性能约为上一代芯片的三倍,单芯片额定功耗为 600W。

中昊芯英联合创始人、CTO 郑瀚寻将性能提升归因于几项硬件调整:计算流水线重构,双芯粒同基板封装,以及片上存储容量和带宽提升。中昊芯英称,目前已经完成 Qwen、DeepSeek、GLM 等主流开源模型的基础适配,并能在新模型发布后较快跑通流程。

基础适配和商业化效果之间仍有距离,要把模型的吞吐量、延迟和成本调到可用水平,往往需要围绕算子、编译工具和调度策略持续优化,国产 AI 芯片行业常说“从可用到好用”,背后说的正是这段漫长的过程。

千卡集群落地杭州,国产TPU接受检验

此次落成的杭州国产 TPU 千卡集群,由杭州电信、中兴通讯和中昊芯英共同建设,面向大模型训练、推理和科学计算等场景提供算力服务,它也是中国电信体系内首个大规模国产 TPU 集群部署项目。

运营商正在经历角色变化,过去,客户租用的是服务器、存储和带宽;现在,越来越多企业希望直接获得模型调用能力,或按照 Token 购买服务。

杭州电信并没有将 TPU 视为唯一选择,其现有布局中同时包含 GPU 算力池,也在探索其他国产芯片路线。未来的智算中心很可能长期保持异构状态,芯片架构各自承担擅长的任务,运营商负责将底层资源组织成面向用户的服务。

这种模式对集群调度提出了更高要求。杭州电信方面透露,经过数月软硬件调优,TPU 集群的 Token 输出效率较年初提升超过 10 倍。这个数据是系统优化的结果,模型版本、算子实现、服务器配置、网络带宽和调度方式,都会影响最终能交付多少有效 Token。

中兴通讯承担网络和系统集成能力,千卡集群向万卡规模扩展时,芯片之间的连接会迅速成为瓶颈。计算能力提升得越快,通信、存储和散热越容易拖住整体效率,这都是智算中心走向规模化后绕不开的问题。

谷歌 TPU 的经验说明,专用芯片的价值往往建立在完整的软硬件体系之上,对于国内厂商而言,芯片研发、量产交付和软件生态仍需同步推进。(本文首发于钛媒体APP,文|TechPulse,作者 | 张帅,编辑 | 盖虹达)

(来源:钛媒体)



用户登录