AI Price MemoryAI Price Memory
经验博文3.1k Stars官方开源仓库

GLM-5.3 开始帮自己造基础设施:AI 的“递归自我改进”真的开始了吗?

超 10 万卡国产集群 2 周吞吐翻 3 倍背后:为什么说细粒度工程反馈远比单独模型能力更重要

原作者: AI Price Radar 深度观察
21 次浏览
0 次复制
适用模型: GLM-5.3 / Codex++ / Claude Code / All Models

GLM-5.3 开始帮自己造基础设施:AI 的“递归自我改进”真的开始了吗?

“让 AI 帮写几行前端业务代码”在今天早已屡见不鲜。

但如果一个 AI 开始深度参与建设运行下一代 AI 自己的万卡推理基础设施呢?

2026 年 9 月 17 日,智谱技术团队(Z.ai)正式发布了一篇引发系统工程界热议的技术长文:

*《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》*。

文中披露,在 GLM-5.3-Flash 的生产环境部署过程中,一个由 GLM-5.3 驱动的 Infra Agent 深度参与了整套推理底层系统的建设与性能榨取。(Z.ai 官方技术报告)

乍听之下,许多人可能会产生科幻式的联想:*“AI 已经开始自己造自己、实现奇点闭环了吗?”*

答案是:目前还没有那么神化。但剥离掉宣传修辞后,它所展示的技术演进路径,比单纯的噱头重要得多。


一、发生了什么:超 10 万卡集群与 2 周 3 倍的吞吐飞跃

根据 Z.ai 公布的信息,GLM-5.3-Flash 的生产推理集群由超过 100,000 颗中国自主可控 AI 加速芯片互联而成。

这绝非把现成开源框架复制粘贴过去那么简单。面对全新的模型拓扑结构、1M 超长上下文、原生多模态混合流量,团队必须跨越一系列严苛的硬核工程壁垒:

  • 自定义算子 Kernel 缺失或效率低下;
  • 显存带宽墙与芯片间跨卡通信瓶颈;
  • 动态 Tensor Parallelism(张量并行)与 Pipeline 并行切分策略选择;
  • 缓存精度量化(W8A8 量化、混合精度 KV Cache)下的数值稳定性。
  • 原本这些属于典型高精尖系统架构师的调优范畴。而 Z.ai 披露,其中的代码审查、底层 Kernel 优化、性能 Profiling 和大规模切分实验,大量由 GLM-5.3 驱动的 Infra Agent 协同人类工程师并行推进。

    落地成效

  • 两周投产:从底层硬件完成适配,到系统承接全量真实生产流量,耗时不到两周;
  • 吞吐翻倍:端到端推理吞吐量相比首版未调优状态提升了整整 3 倍
  • 核心优化落地:覆盖了 ReplaySSM、Layer Split、Encode-Prefill-Decode 物理架构分离等前沿工程实践。(Z.ai 官方博客)

  • 二、为什么值得关注:理性辨析“递归自我改进(RSI)”

    所谓 Recursive Self-Improvement(递归自我改进,简称 RSI),在经典计算机科学假设中通常指的是:

    code
    AI 写出更优的训练/系统代码 → 产出更强的下一代 AI → 下一代 AI 进一步优化底层系统 → 产生指数级迭代循环

    如果这个闭环完全脱离人类干预自主加速旋转,那就是理论上的“技术奇点”。

    但 Z.ai 在报告中非常实事求是地澄清:当前状态绝不是无人看管的自主进化

  • 人类掌控边界:顶层性能目标、安全边界红线、验收测试集以及关键系统级变更的审核权,依然牢牢掌握在资深人类工程师手中;
  • 真实定位:更严谨的定义是 “高自动化水平的 AI 辅助 AI 研发(AI-Assisted AI R&D)”
  • 这件事情真正震撼业界的地方,不在于模型会不会写某个 CUDA 或专用加速器 Kernel,而在于:AI 已经正式从“编写单体应用”迈进了“参与塑造自身算力基石”的深层正反馈阶段。


    三、对普通用户与开发者的实际价值:反馈(Feedback)远比聪明重要

    Z.ai 在工程复盘中分享了一个极其关键但常被忽视的洞见:

    “仅仅给 Agent 塞进更多代码库,并不能让它成为优秀的系统工程师。决定 Agent 产出上限的,是系统回传给它的反馈质量。”

    很多开发者在日常使用 Claude Code、Codex 或 Cursor 时,往往陷入这样的无效对话:

    开发者:“帮我把这个复杂系统性能优化一下。”
    AI 改完代码。
    开发者:“感觉还是慢,而且好像报错了,你再改改。”

    这种模糊至极的负反馈对于模型毫无价值。模型根本无从得知:

  • 是延迟崩了,还是吞吐崩了?
  • 是第几层出现了通信阻塞,还是显存被 OOM 撑爆?
  • 是数值溢出精度偏差,还是锁竞争导致死锁?
  • Z.ai 团队让 Infra Agent 发生质变的做法,是在外围搭建了一套高精度的自动化工程反馈闭环

    code
    Agent 提交优化 Patch
      ↓
    自动沙箱部署运行
      ↓
    多维度高敏观测(精确到纳秒的 Profiling、数值精度矩阵比对、局部回归测试、A/B 基准打分)
      ↓
    生成结构化错误诊断切片与调用栈追踪
      ↓
    精准喂回给 Agent:“第 4 层注意力权重差异超 0.003,GEMM 耗时异常增加 12%”
      ↓
    Agent 依据确定性事实做出精准二次收敛

    给日常开发者的避坑指导

    无论你是使用 AI 编写 Python 后端、优化 SQL 查询还是构建 Next.js 前端,请记住这个黄金铁律:

  • 别再让 AI 猜谜:不要用空洞的“好像有问题”去要求重新生成;
  • 构建本地验证流水线:为每次修改配置单测、基准脚本(Benchmark)或类型检查;
  • 精准投喂错误信息:把编译器的确切 Traceback、测试失败日志或 Profiler 输出原封不动丢给 AI;
  • 让 AI 拥有自我纠错的闭环系统:一个能自动运行 test -> fix -> verify 循环的普通模型,表现会彻底碾压一个没有测试反馈的顶配模型。

  • 四、我怎么看(AI 价格雷达观点)

    过去一年,整个行业陷入了疯狂的参数与榜单内卷:

    *比谁的上下文更长,比谁在离线基准测试上又高了 0.5 分。*

    但 GLM-5.3 这个案例向我们昭示了下半场竞争的核心分水岭:

    单体模型的“裸智商”终将遭遇收益递减,而“模型 + 运行环境 + 自动化反馈循环”构建的工程闭环,才是工业级生产力的决定性护城河。

    一个没有工程反馈机制的 SOTA 模型,就像一个蒙着眼睛在黑夜里狂奔的顶尖短跑运动员;

    而一个拥有严密测试套件、精细日志切片与自愈重试流水线驱动的系统,哪怕使用低成本模型,也能持续、稳定地产出坚如磐石的系统代码。

    对于广大追求效费比的开发者与企业而言:别再沉迷于等待下一个“完美模型”,抓紧为你的 Agent 打造健全的测试与反馈流水线,才是当下最确定、回报率最高的投资。

    满血体验推荐

    想要获得满血无降智体验或运行该技能?

    查看 ChatGPT Plus 当前全网店铺最低报价、合租车位、直充与质保对比。

    查看 ChatGPT Plus 实时底价