新闻动态

  • 首页Our Projects牛来”真身:智谱GLM-5.3 Flash揭晓,首个原生多模态并跑在国产卡上

牛来”真身:智谱GLM-5.3 Flash揭晓,首个原生多模态并跑在国产卡上

2026-08-27 9007

最近网络上热议的神秘模型“牛来”(Ox Alpha)终于揭开面纱——它正是智谱刚开源发布的 GLM-5.3 Flash,且为5系列中首款原生多模态模型。短短几天内,这个模型就被大量实测和应用,流量与热度一路飙升:在 OpenRouter 上首日登顶并刷新单日 tokens 使用记录,在 OpenCode 上也打破了 DeepSeek 连续霸榜的势头。

我们也拿到了 GLM-5.3 Flash 的内测资格,做了复现测试。社区里一个热门玩法是让“牛来”把 SpaceX 的 Raptor 猛禽发动机做成可交互的 3D 网页演示。实测中,模型在接到同样的 prompt 后,能够免人工介入、自动生成出完整的 3D 项目,效果相比早期版本更为精细。有博主在多次尝试后感慨模型像是在“持续学习”,而我们的测试结果也显示出明显进步。

about image

在模型规格与能力上,GLM-5.3 Flash 标注为 320B,但整体能力全面超越体量为 753B 的 GLM-5.2。最新 AA 排行榜显示其得分已达 57 分,跻身全球前列,与 Claude Opus 4.8 持平。定价方面,GLM-5.3 Flash 的标准价仅为 5.3 版本的约十分之一,限时折扣更低,整体定价低于同类一些竞品。 千亿球友会

更令人自豪的是,试验中累计的 62T tokens 全部跑在国产显卡上——也就是说,外界追了一个月的神秘模型,实际上是一款“纯血国产”成果。

作为首个原生多模态版本,我们重点检验了其视频与音频的联合理解能力。一次测试是让模型处理一段多人发言的视频,要求识别不同说话人并生成带人物颜色区分与卡拉 OK 高亮效果的字幕,字幕需与最终时间轴重新对齐并保证可读性。GLM-5.3 Flash 能够从画面中捕捉到仅出现一次的名牌信息,从而把声音、名字与人物对应起来,整体多模态处理令人满意。

另一次更具挑战性的任务是输入整部电影,让模型剪辑并生成一条中文电影解说视频,要求梳理主线剧情、人物关系、突出情绪转折,并同步生成配音与中文字幕。结果显示,GLM-5.3 Flash 能理解长时段剧情、提取关键片段并输出连贯的解说内容,成片质量达到了可用水准。 千亿球友会

总体来看,GLM-5.3 Flash 在多模态理解与生成上表现稳健、效率高、成本更低,并且在国产硬件上完成了大量负载验证。接下来,团队还计划对其编码能力与更复杂的应用场景做更深入的评估。

订阅我们的时事通讯

获取更多更新