2026 年 6 月 17 日,智谱 AI 正式发布 GLM 5.2。这是智谱 GLM 系列在 5.0、5.1 之后的又一次重要迭代——编程能力首次对标 Claude Sonnet,多模态覆盖图像/视频/语音/代码执行,同时延续开源策略(GLM-5-Edge 同步开源)。本文从开发者视角梳理这次升级的关键变化。
核心升级:三个维度的"全面对标"
GLM 5.2 的发布会有句反复强调的话:"对标业界最强,延续开源承诺"。具体落到三个维度:
- 编程能力:在 SWE-Bench Verified、HumanEval、LiveCodeBench 等编程评测上,5.2 相比 5.1 提升明显,实测表现接近 Claude Sonnet 4.6,显著超过 DeepSeek V3 和 Qwen3。
- 全模态理解:支持图像理解(OCR + 视觉推理)、视频理解(60 秒以内片段分析)、语音对话(端到端 TTS + ASR)、代码执行(沙箱 Python),开发者不需要拼接多个模型。
- 推理与 Agent:深度思考模式对标 o1,支持 ReAct、Plan-and-Solve 等推理架构,函数调用稳定性提升。
与 Claude、GPT、Qwen 的横向对比
GLM 5.2 在国产开源大模型里的定位非常清晰:
- 对比 Claude Sonnet 4.6:编程 benchmark 接近,中文场景 GLM 略胜,英文长文 Claude 略胜;但 GLM 完全开源可本地部署,Claude 只能 API。
- 对比 GPT-4o:多模态维度 GPT-4o 仍领先(尤其图像生成),但 GLM 5.2 在多模态理解 + 中文场景已经够用,且开源免费。
- 对比 Qwen3:同为国产开源,Qwen3 在数学推理略强,GLM 5.2 在编程和工具调用生态略强;两个都是企业自部署的首选。
关键差异点:GLM 5.2 是少数把"编程 + 多模态 + 推理 + 开源"四件事同时做扎实的国产模型。对企业 AI 平台团队来说,这意味着不需要采购多个模型拼装,一个 GLM 5.2 就能覆盖大部分场景。
对开发者生态的实际影响
GLM 5.2 直接利好这几类开发者:
- 企业 AI 平台团队:GLM-5-Edge 开源版本可本地部署,数据不出企业,适合金融、医疗、政务等合规要求高的场景。结合 MCP 协议可以快速构建企业级 Agent。
- AI 编程工具开发者:GLM 5.2 的编程能力达到生产级,可以替代 Claude API 用于 Cursor 类工具的中文场景,成本下降 80%+。
- 独立开发者 / 个人用户:chatglm.cn 网页版免费使用 GLM 5.2,包含深度思考、Artifacts、Agent 等高级功能,无需翻墙。
如何上手
三种方式体验 GLM 5.2:
- 网页版:访问 chatglm.cn,免费使用完整功能
- API:bigmodel.cn 注册申请,价格延续 GLM 系列(输入 ¥0.5/百万 token 起,深度思考模式加价 3 倍)
- 本地部署:GLM-5-Edge 在 Hugging Face 和魔搭社区开源,支持 4-bit 量化,单卡 4090 可跑
小结
GLM 5.2 的发布,标志着国产开源大模型在"编程 + 多模态"这两个高价值场景上,首次追平了国际一线水平。结合智谱一贯的开源策略,GLM 5.2 很可能成为未来一年国内 AI 应用开发的事实底座之一。下一阶段值得观察的是:DeepSeek V5 的发布节奏、Qwen3 的多模态扩展、以及开源社区对 GLM-5-Edge 的微调生态发展。