本页目录 · 7▾
· 1 分钟阅读
GLM-5.3 没有换底座,大模型开始进入「榨取基座」时代
GLM-5.3 沿用约 743B 基座,却宣称编程能力提升约 50%,它把竞争推向后训练与强化学习,但训练成本、推理预算、开放权重和第三方复现仍待验证。
GLM-5.3 没有换底座,大模型开始进入「榨取基座」时代
2026 年 8 月 14 日,GLM-5.3 发布时,参数表没有出现旗舰模型常见的膨胀:它仍沿用 GLM-5.2 约 743B 的基座。变化被放在另一列,智谱称编程能力较上一代提高约 50%,主要增益来自后训练和强化学习。
把这两个数字放在一起,比追问它是否追平某个海外模型更有意思。当 Kimi K3 约 2.8T、DeepSeek V4 约 1.6T、GLM-5.3 约 743B 时,问题已经不只是“谁的模型更大”,而是旧基座还能被训练出多少新行为,以及这份提升究竟把成本转移到了哪里。
参数没变,能力曲线却被重新画了一次
GLM-5.3 的反差首先来自规模。它与 GLM-5.2 基本使用同一基座,但智谱给出的编程能力代际提升约 50%。横向比较这些模型,只能说明它们处在不同的参数区间,不能直接推出谁的训练效率更高。
真正需要追问的,是没有重做大规模预训练之后,新增能力从哪里来。GLM-5.3 把后训练、强化学习、工具调用和长任务验证放到了更靠前的位置。模型升级不再只表现为换一套更大的底座,也可能表现为同一个底座在规划、执行和纠错上的行为变化。
但这条路线仍有两个问题:它减少了多少预训练成本,又增加了多少后训练与推理计算?如果模型需要更长的思考过程和更多工具调用才能完成任务,参数规模不变,并不等于总成本不变。
GLM-5.3 的赌注,是旧底座仍有未兑现的能力
GLM-5.3 的意义不只是多了一个编程模型,而是把竞争焦点移向了“同一基座还能被训练出多少新行为”。如果这个判断成立,模型厂商需要持续经营的就不只是预训练集群,还包括任务环境、奖励设计、失败样本和验证流程。
下一轮模型竞争,未必先比谁造出更大的底座,而是比谁更早找到同一底座尚未兑现的能力。
智谱技术博客把这件事说得很直接:
“我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。”
—— 智谱技术博客引语,经爱范儿转载
智能上界:这里不是一个已经测得的固定分数,而是模型在规划、工具使用、错误修正、安全审计和长任务执行等行为上,仍可能通过训练继续获得的能力范围。
这句话能够支撑“后训练仍有空间”,但不能推出预训练扩展已经失效,也不能证明 743B 天然比更大的模型更有效率。同基座升级证明的是训练方法仍能改变模型行为,至于这种变化能否稳定复制,还需要成本和复现实验确认。
被“榨”出来的能力,开始从写代码转向完成工作流
GLM-5.3 的公开实测没有停留在生成页面。CyberGym 白盒代码审查中,它的成绩从 GLM-5.2 的 77.2% 提高到 84.5%;另一项包含 898 道题、限时 6 小时的安全测试中,模型完成了 130 道题。这些任务要求模型理解代码、寻找漏洞、组织攻击路径,并不只是输出一段看起来合理的代码。
在一个预埋安全问题的 Node.js 应用中,模型用约 7 分钟生成了 348 行审计报告,识别出预设的 12 类漏洞。随后,它用 9 分 20 秒修改 22 个文件,新增 1463 行代码并补充回归测试。项目脱离原 Agent 会话后重新运行,54 项测试仍全部通过。
这里更重要的不是某一个时间数字,而是模型完成了发现、修改和验证三个环节。智谱将这种能力描述为:
“began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains.”
—— 智谱,GLM-5.3 漏洞推理能力描述
更有意思的细节出现在一台没有 NVIDIA GPU 的 Mac 上。模型通过 Docker 内的 CUDA Toolkit 完成编译验证,但没有把编译通过写成 GPU 验证成功,而是将真实 GPU 执行、CPU/GPU 数值一致性和性能测试分别标为 UNVERIFIED。
量子位将这种边界概括为:
“能做的尽量做,没做的明确说没做。”
—— 量子位,GLM-5.3 CUDA 实测总结
Coding Agent 的评价标准因此多了一层:不仅要看它能不能生成代码,还要看它是否能管理证据边界。不过,这些结果仍会受到 ZCode、工具权限、系统提示词和测试环境影响,不能全部归因于基础模型本身。
后训练不再是收尾工序,而是一套持续开发系统
基座负责通过大规模预训练形成通用能力;后训练把这些能力组织成更适合交互和执行的行为;强化学习则通过任务反馈,继续塑造规划、验证和工具使用方式。后训练做得更强,并不意味着预训练规模不再重要。
智谱称,从 GLM-4.5 开始就持续使用 Slime 后训练框架;GLM-5.3 沿用 GLM-5.2 基座,并在相同基座上推进后训练。Slime 同时支持部分 GLM、Qwen、DeepSeek 和 Llama 3 模型。
这个时间顺序说明,后训练正在从发布前的最后一道工序,变成模型公司的持续研发系统。任务如何采样、模型如何获得反馈、强化学习如何运行,都会影响最终能力。
智谱开放 Slime,也是在开放一部分方法。不过,Slime 材料里出现的 128×H100,只是 DeepSeek-R1 的训练配置示例,不是 GLM-5.3 的完整训练算力披露。训练数据、完整训练代码、许可证、推理成本和完整复现实验配置也没有完整公开,因此“高效推进”暂时还缺一张可以核算的成本表。
总参数是一把方便的尺,但量不出后训练效率
“743B 打 2.8T”是最容易传播的结论,也是最容易误导的比较。总参数没有包含激活参数、训练数据质量、上下文长度、推理 Token、工具链和测试时计算量。两个模型即使参数规模不同,也可能通过不同的数据和推理策略完成相似任务。
同样,没有重做预训练,也不意味着升级成本很低。强化学习可能消耗大量计算,模型还可能通过更长的推理过程和更多工具调用换取更高的任务完成率。参数没有增加,只能说明成本结构可能发生变化,不能直接说明单位任务成本下降。
“提升约 50%”也需要拆开验证:使用了哪些基准,如何加权,Prompt 和采样参数是否一致,运行了多少次,是否设置了相同的 Token 预算,结果有没有置信区间。缺少这些信息时,这个数字更适合被理解为发布阶段的能力主张,而不是适用于所有编程任务的统一增幅。
更有效的比较方式,是把模型放回相同任务、成本、延迟和工具权限中,看谁完成得更多、错误更少、结果更稳定。扩大基座追求能力容量,强化后训练追求调用现有容量,两条路线仍会并行。
能力被释放了,验证与安全债务也被放大
GLM-5.3 的安全测试留下了两组不能混用的统计:一组是 2404 个漏洞、1088 个中高危漏洞、220 个项目;另一组是 2436 个漏洞、269 个项目。它们可能对应不同统计时点或披露范围,但现有材料无法确认差异原因,因此不能拼接成一套确定结果。
模型也展示了明显的能力边界。人体血液循环 3D 系统虽然能够运行,但器官出现堆叠,视觉效果较为粗糙。安全审计中,一个 CSRF 风险被标成 CONFIRMED,模型后来又意识到攻击是否成立取决于浏览器 Cookie 行为。
代码能运行、漏洞能被指出,不等于科学准确、视觉专业或安全结论已经足够可靠。接入现有 Agent Harness 后,问题还会从模型能力延伸到权限协议。通过 Claude Code 调用 GLM-5.3 时,自动命令审批出现提示:auto mode cannot determine thesafety of Bash right now.
这意味着模型能力、工具调用和权限判断之间还没有完全对齐。需要科学准确性、生产级视觉交付、无人值守终端权限或合规审计结论的团队,不能把当前演示直接当成人工验收的替代品。
开放权重同时扩大了本地部署和安全研究的空间,也降低了漏洞利用自动化的门槛。发布时,完整权重计划在安全审查结束后约两周开放,说明 Coding 能力与网络攻击能力已经出现在同一个发布决策里。模型越能完成完整工作流,外部验证和权限隔离就越不能被放到发布之后再处理。
真正的答案,要等权重、价格和复现结果落地
回到开头的 743B,公开材料显示 GLM-5.3 在沿用同一基座的情况下出现了明显的行为变化,但还没有证明这条路线具有可持续、可比较的经济效率。
完整权重是否按计划开放,许可证和商用限制如何规定,第三方能否复现关键基准,都会决定这次升级最终属于产品叙事,还是方法变化。
API 价格、限速、上下文长度和实际 Token 消耗同样重要。如果模型用更长推理换来更高完成率,单位任务成本就不能只看输入输出单价。开发者需要把模型放回真实工作流,比较它在权限、回归测试、部署和人工复核环节的总消耗。
Slime 是另一个观察点。如果其他 GLM、Qwen、DeepSeek 或 Llama 3 模型能在相近训练预算下复现类似增益,“榨取基座”才会从一家公司的产品叙事变成可验证的方法变化。短期内,厂商仍会同时押注更大的预训练和更强的后训练,只是预算如何分配,正在比单纯公布参数规模更重要。
这件事还在演进。下一个节点不是另一张榜单,而是权重开放后的第三方复现,以及正式 API 上线后可核算的单位任务成本。