智谱AI 专家访谈深度解读:GLM-5、算力博弈与国内AI竞争格局
前言
最近某机构对智谱 AI 做了一次深度专家访谈,内容涉及 GLM-5 的技术演进、算力分配策略、与 DeepSeek/Kimi 的竞争格局、出海挑战、国产芯片等多个核心议题。信息密度很高,值得详细梳理。
一、GLM-5 的 Agent 和 Coding 能力为什么突然强了?
智谱的 Agent 和 Coding 能力从 GLM-4.5 开始就一直很强,至少是业界最强之一。
关键时间线:
- GLM-4.5 阶段:确立了 ARC 战略——Agentic、Reasoning、Coding 三大方向同时投入
- 2025年9月:率先推出 Coding Plan,在 GLM-4.6 中进一步发展
- GLM-4.7:Coding 能力发挥到极致,业界口碑达到高峰,但也基本耗尽了当时的算力资源
- 2026年:GLM-5 和 GLM-5.1 等 5.x 系列问世,模型尺寸更大,相对实力更强
过程中有一个有趣的反思:Reasoning 的直接经济价值有限,Agentic 在很长一段时间内找不到合适的应用场景,最后逐渐与 Coding 融合。2025 年下半年,公司的主要方向变成了 Agentic Coding,与 Claude Code 等产品结合。
二、一个月迭代一代,训练周期真那么短吗?
外界看到一个月发布一代,以为训练周期就是一个月。实际上多条研发线路是并行推进的。 GLM-5 的训练在 GLM-4.7 还没退役时就开始了。
模型团队花费最长的时间不是训练,而是 **”观察”**。智谱的强项在于抓住市场机会的能力——通过深入观察市场风向、评测结果,判断哪些模型表现稳固、哪个技术方向代表未来趋势,从而在研发上少走弯路。
当前 GLM-5 的水平:比较接近 Claude Sonnet 4.6,但存在明显短板(例如缺乏多模态能力)。可以看作一个稍弱化的 Sonnet 4.6:
- 从 benchmark 评测看,差距约 4 个月
- 从底层技术扎实程度看,差距约 6 个月
三、蒸馏还有用吗?Anthropic 加强管控怎么办
蒸馏在模型整体能力中的占比正在持续降低。
关键认知:蒸馏的核心作用不是赋予模型核心能力,而是让模型在 Code 或 Coding Agent 等场景下的表现风格与 Claude 等顶尖模型相似。
当前业界模型能力的提升(如 DeepSeek),主要还是靠架构创新、预训练和强化学习。智谱发布的 SFT-Bench Pro 能拿到 SOTA 成绩,主要靠的就是强化学习,而不是蒸馏。
至于应对 Anthropic 等公司的监管,这类操作通常不是模型公司直接做的,而是通过第三方执行——背后有利益驱动。
四、算力分配:没有固定比例,全是动态调度
算力分配比例变动非常剧烈,没有固定的训练/推理占比。
DeepSeek 的新架构可以将 FLOPs 降低到原先的十分之一,这会显著减轻推理端压力,从而把更多资源重新分配给训练。没有技术突破就只能靠堆资源,有了技术突破则可以回收资源。
潮汐调度:智谱将算力资源池化管理。推理负载在凌晨等低谷期有空闲,这些算力会被调度给训练任务。一个集群的启停大约只需半小时,而夜间的闲时窗口通常有 8-10 小时,能被高效利用。
模式总结:优先保障线上服务,空闲资源全部投入训练。
五、未来算力:囤卡还是相信技术?
这是一个核心博弈。
- 如果相信技术创新 → 更多资源投入到人才储备和 Infra 团队,通过提升训练效率来弥补算力不足
- 如果判断技术不会有重大突破 → 最理性的选择就是囤积计算卡
作为一家初创公司,智谱更倾向于相信技术的力量——因为与资金雄厚的大厂相比,智谱无法在囤积算力上进行竞争。算力储备策略本质上是一种多方博弈,很难精确预测。
用于训练的算力预计不会下降,反而可能投入更多。市场和资本对 AI 公司的估值主要基于其产品能力和技术领先性,持续推出领先的大模型是根本,这需要遵循 Scaling Law。
六、国内竞争格局:第一梯队怎么排
根据访谈,国内模型厂商的梯队划分如下:
第一梯队(各有特色)
| 厂商 | 优势 | 短板 |
|---|---|---|
| DeepSeek | 模型参数量大,世界知识强,前端体验好 | 无 |
| Kimi | 模型参数量大,审美较好 | 无 |
| 智谱AI | Coding + Agent 能力独一档,深度结合最好 | 模型参数量相对小,多模态较弱 |
关键判断:如果抛开模型大小,仅从对特定场景的钻研深度和数据储备来看,智谱在 Coding 技术上是独一档的。
第四名是小米的 MiMo,但与前三者有档次差距。千问、混元等模型在其后。MiniMax 应归入第二梯队,其模型能力不佳主要是因为模型尺寸过小,但这不反映团队实力。
七、DeepSeek 的低价策略为什么别人学不来?
DeepSeek 是一家 纯粹的 to C 企业,其商业模式有几个其他厂商无法模仿的特点:
- 不维护旧版本模型——直接淘汰 V3.1、V3.2 等旧版本,资源管理效率极高
- 不提供 to B 的 SLA——没有服务等级协议和稳定性保障义务
相比之下,智谱 AI 等商业服务机构无法瞬间关停上一代模型,必须为企业客户保留旧版本。因此尽管其他厂商可能认同 DeepSeek 模式在毛利上的潜力,但由于自身商业定位的不同而无法采纳。
DeepSeek 正在以一个独立商业主体的身份深入思考其发展路径,所有商业行为均以自身盈利为目标——**它不是一个不计成本的”玩具”**。
八、to C 市场:豆包领先但战争还没开始
尽管豆包在 2026 年春节后用户数增长显著,呈现一边倒态势,但这并不意味着 to C 市场的战役已经结束——甚至可以说战争尚未开始。
关键原因:当前所有厂商都未进入收费阶段,尚未形成经济正循环,仍处于”军备竞赛”的准备阶段。
AI 行业与传统互联网存在根本不同:没有规模效应。用户越多,单位服务成本反而可能越高——集群规模变大导致网络通信更复杂,GPU 优化也更困难。
这意味着:在军备竞赛中领先的赢家,在战争真正打响(开始收费)时,也可能因为高昂的成本而亏损最快。
九、出海:规模化的玻璃天花板
中国大模型厂商出海面临规模化的巨大困难。当收入规模达到 10 亿以上时,会直接面对持有美国许可证的供应商(拥有充足的 B 卡算力和政府关系优势)。
大模型作为政治敏感性技术,海外大型机构客户采用时非常谨慎:
- 阿里云海外总部设在新加坡,公有云可覆盖散户,但服务大型机构仍遇障碍
- 海外大客户会使用开源模型进行评估和 know-how 积累,但不会用于核心业务
- 出海更多是间接的品牌建设行为,提升国内口碑
十、国产推理芯片:能替代 H200,但替代不了 Blackwell
华为昇腾 910B 对标的是英伟达 H200,主要作用是弥补 H200 在中国市场的缺位。
但它无法替代英伟达 Blackwell 系列(B 系列):
- H 系列推理智谱 AI 这类模型,速度很难超过 50 token/s
- B 系列推理 DeepSeek 的 FP4 模型可达 150 token/s
是否采购国产芯片,取决于未来市场对何种类型算力的具体需求。如果应用场景对推理性能和吞吐量极为敏感,B 系列仍是首选。
另外,海外用户对推理速度的敏感度远高于国内用户。海外主流厂商已开始采用 B300 级别芯片,中国用户可以接受的响应速度在海外可能被认为是无法忍受的。
十一、竞争策略:交替领先中的差异化
行业内的领先地位是交替变化的。各家厂商的优缺点都非常明显,制约点也多。
即使业内人士也难以预测”5 月 1 日”之后行业会发生什么。整个行业的发展路径并非按预定计划进行——一个微小的观察或事件都可能导致公司放弃原有方向、调整战略,这种变化每天都在发生。
在当前竞争格局下,差异化路线是关键。智谱的传统优势在于模型与 Coding 及 Agent 能力的深度结合,这是它的护城河。
本文内容整理自某机构对智谱AI的专家访谈纪要,仅供参考。