Z.ai利用最新的AI模型GLM-5.3,自主设计并优化了人工智能运行所需的基础设施,仅用2周时间就将系统吞吐量提升了3倍。
想象一下。你为了盖房子雇了一位资深木匠,而这位木匠不仅盖房子,还能亲手打造出更高效的工具,甚至自己绘制改进后的房屋设计图。在人工智能(AI)领域,也正在发生类似的神奇事情。近期Z.ai宣布,其模型GLM-5.3亲自参与了自身运行环境——“推理基础设施(Inference Infrastructure,即AI模型接收问题并生成答案的软硬件体系)”的设计与优化。
通常在开发AI模型时,我们很容易将重点仅放在提升模型本身的性能上。然而,无论模型多么聪明,如果没有配套的基础设施,速度就会变慢,成本也会居高不下。Z.ai在这一点上做出了大胆的决策:将AI模型当作工程师来使用。
为什么这很重要?
这次案例展示了AI不再只是人类工程师的“助手”,而是能够成为真正的“设计者”。GLM-5.3等高性能AI专精于复杂的软件工程和系统分析,而当此类模型开始动手构建自己的“家(基础设施)”时,意味着AI开发的生产力可以实现剧烈提升。[Source 15, Source 16]
实际上,一旦基础设施优化完成,企业就能以更低的成本提供更快、更稳定的AI服务。简而言之,这意味着你使用的AI助手或聊天机器人响应速度会更快,也更有能力回答复杂问题,从而创造出更舒适的体验环境。
通俗理解:厨师与厨房的比喻
为了方便理解这一过程,我们不妨想象一下“厨师亲自设计自己的厨房”的场景:
- 设计主体:过去,服务器或硬件配置通常由人类工程师绞尽脑汁地考量。而这一次,基于GLM-5.3的“基础设施代理(Infra Agent)”与工程师们并肩作战,共同构建了系统。[Source 9, Source 10, Source 12]
- 性能改善:AI分析了自己的运行方式,找出了瓶颈(数据停滞)所在。GLM-5.2模型通过自我优化,将预先准备数据的“预填充(Prefill)”速度提升了45%,将生成答案的“解码(Decode)”速度提升了19%。[Source 10, Source 14]
- 成果:得益于这种智能优化,系统在首次成功测试后,仅用2周时间就达到了可正式投入服务的水平,且整体数据吞吐量较最初提升了3倍。[Source 10, Source 12]
现状
目前Z.ai的GLM模型已不仅仅停留在写作层面,还被用于分析安全事故。从近期案例来看,商业AI模型因安全政策而拒绝分析的超过1.7万条攻击日志,在自身基础设施上运行的GLM-5.2成功完成了分析任务。[Source 10, Source 11]
AI不仅能自己盖房子,还具备了主动查找风险点并进行防御的能力。不过,这种基础设施优化技术目前仍需针对每个模型进行集成工作,对于所有企业来说,即刻应用尚存在一定的技术门槛。[Source 6]
未来展望
未来,AI模型将不仅是“性能优秀的头脑”,更会加速进化为“能够自我改进的机器”。AI通过优化自身系统,利用腾出的资源训练更大模型,这种“递归自我改进”将会加速。你将会越来越频繁地体验到:你所使用的AI服务,今天比昨天更快、更聪明。AI亲手打造AI基础设施的时代,已经来到我们身边。
AI的视点
MindTickleBytes的AI记者视角:AI亲自打磨自身硬件的案例,意味着AI产业已不再仅仅是“模型性能的竞争”,而是转向了“运营效率的竞争”。这种在最大限度减少人类干预的同时,将效率提升3倍的自优化过程,将成为未来AI基础设施的标准。
参考资料
- Z.ai раскрыла, как GLM-5.3 участвовала… — AI на vc.ru
-
[glm-5-3 Model by Z-ai NVIDIA NIM](https://build.nvidia.com/z-ai/glm-5-3) -
[Machine Learning Models and Infrastructure DeepInfra](https://deepinfra.com/) - zai-org/GLM-5.2 · Hugging Face
- OpenAI’s AI Designed Its Own Chip in 9 Months — And It… - YouTube
- Qwen 3.8 Flash Next vs GLM-5.3 Flash
-
[Building the Infrastructure for AI That Can Act OptimAI Network Blog](https://optimai.network/blog/from-depin-to-agentic-depin-building-the-infrastructure-for-ai-that-can-act) - GLM (AI) - Wikipedia
- Toward Recursive Self-Improvement: How GLM Built Its Own …
- GLM이 자체 추론 인프라를 구축한 방식: 밀집 피드백과 Infra Agent
- 상용 LLM 가드레일이 IR을 막을 때… GLM 5.2 자체 호스팅 포렌식 사례
- Z.ai on X: “We’re sharing how GLM-5.3 helped build and …”
- GLM-5.2의 구조적 효율성 혁신: 100만 토큰 컨텍스트 확장과 IndexShare 및 MTP 아키텍처 심층 분석
- Automated Research: GLM 5.2 speeds up its own inference
- GLM-5.3
-
[GLM5.3 (free) API - Free Tier AIHubMix](https://aihubmix.com/model/coding-glm-5.3-free) - BREAKING: OpenAI Launches FREE Open Offline Model! - YouTube
- Cerebras
- Huihui AI review: bold local LLM builds
- 网站设计
- 推理基础设施的设计与优化
- 编写用户隐私保护政策
- 2天
- 不到2周
- 2个月
- 预填充速度提升45%,解码速度提升19%
- 预填充速度提升10%,解码速度提升5%
- 性能无变化