AI Price MemoryAI Price Memory
经验博文

「西方的 DeepSeek」兑现了:Reflection Beam 正式发布,501B 混合专家模型主打"花更少算力、办同样的事"

昨天爆料、今天官宣:Beam 以 GLM-5.2 同档的推理代码能力、1/3 的推理算力、Apache 2.0 开放权重入场,10 月权重落地见真章。

原作者: AI Price Memory
23 次浏览
0 次复制
适用模型: Reflection Beam / GLM-5.2 / GLM-5.3 / Kimi K3 / Qwen3.8-Max / Nemotron 3 Ultra / DeepSeek V4.1 Flash

「西方的 DeepSeek」兑现了:Reflection Beam 正式发布,501B 混合专家模型主打"花更少算力、办同样的事"

结论:先看这几条

  • 昨天爆料、今天兑现:Axios 10 月 4 日爆料 Reflection AI 本月发布首款开放权重模型,美国东部时间 10 月 5 日公司正式公布——模型定名 Beam,5010 亿总参数、每次推理只激活 230 亿参数的混合专家(MoE)架构,纯文本,100 万 token 上下文。
  • 官方自报成绩:SWE-bench Verified 80.9、Terminal-Bench v2.1 80.1、SWE-bench Pro v1 65.5,推理与代码能力与 Z.ai 的 GLM-5.2 处在同一档,但官方称推理算力只需西方同类开放模型的 1/3 到 1/4。
  • 开放时间表:权重将在 10 月内按 Apache 2.0 协议放出,附技术报告和模型卡;目前处于 waitlist 内测 + 最终红队测试阶段。
  • 两个必须打折的地方:所有分数都是官方自报、尚未独立验证;"省算力"的测算口径排除了 prompt 预填充、长上下文注意力等真实部署开销。
  • 对用模型的人:又一个顶级开放权重代码/Agent 模型即将可本地部署,Apache 2.0 意味着商用友好;权重落地前先别急着换技术栈,但可以开始规划评测。

Beam 的强化学习阶段动用了 10500 块 Nvidia GB300(图为 GB300 NVL72 机架)

一、从爆料到官宣:不到 24 小时

10 月 4 日 Axios 独家爆料"多家西方公司本月推出开放权重模型,Reflection 打头阵";10 月 5 日 Reflection 就通过官方博客正式公布了 Beam。昨天我们在站内文章里特别提醒"这只是爆料,不是发布本身"——今天发布本身来了,之前所有的"未知数"(模型名、参数规模、许可证、评测分数)一次性补齐。

Beam 的定位非常明确:代码与 Agent 任务的"主力模型"(workhorse model),目标用户是企业、公共部门和开发者。公司直言要对标三类对手:Anthropic、OpenAI 的闭源旗舰;DeepSeek、Qwen、Z.ai 的中国开放模型;Mistral、Meta、Cohere 等西方开放玩家。最直接的美国对手可能是 Mira Murati 的 Thinking Machines Lab 今年 7 月发布的 Inkling——官方对比显示 Beam 在双方都有分数的 4 项编程测试上超过 Inkling,不过 Inkling 是多模态模型,Beam 是纯文本,两者赛道不完全重合。

二、参数与训练:关键词是"高算力强化学习"

先看硬规格(综合路透社、TechCrunch 报道):

维度Reflection BeamGLM-5.2(Z.ai)Nemotron 3 Ultra(NVIDIA)Kimi K3(月之暗面)
总参数501B约 744B550B2.8T
激活参数23B约 40B55B104B
架构/输入MoE,纯文本MoE,文本MoE,文本MoE,文本+图像
上下文100 万 token100 万 token最长 100 万 token100 万 token
许可证Apache 2.0(计划)MITOpenMDW-1.1定制 license(超大产品需署名)
权重状态10 月内放出已放出已放出已放出
Terminal-Bench v2.1(官方自报)80.181.056.488.3

几个值得注意的点:

  1. 激活参数只有 23B。这是 Beam 最激进的地方——总参数 501B 在开放模型里不算最大,但每次推理只激活 23B,比 GLM-5.2 的约 40B、Nemotron 3 Ultra 的 55B 都少。MoE 的精髓就是"专家会诊,只叫醒相关科室",激活参数直接决定推理时的显存占用和速度。
  2. 预训练 23.8 万亿 token。token 量是模型"读过多少书",这个量级属于第一梯队。
  3. 训练方法:高算力强化学习。官方披露 RL 阶段用了 10500 块 Nvidia GB300,跑了 4 周,产生了超过 1 亿次 rollout(智能体试错轨迹)。思路不是"堆更多参数",而是"让模型用更少的推理步骤想明白"——这正是官方敢喊"省算力"的技术底气。顺带一提,官方还观察到:只在代码/Agent 任务上做 RL,模型的网页浏览能力也跟着变好了,说明智能体能力存在跨任务迁移。

三、成绩单逐项看:和 GLM-5.2 同档,但别只看 headline

官方公布的分数(注意:均为官方自报,对手分数引自 Artificial Analysis 与 DataCurve 的公开数据,尚未有第三方独立复现):

  • SWE-bench Verified:80.9,对比 Nemotron 3 Ultra 的 70.7——这是 Beam 赢得最漂亮的一项,真实软件工程任务修复能力。
  • Terminal-Bench v2.1:80.1,对比 GLM-5.2 的 81.0、DeepSeek V4.1 Flash 的 90.6、Kimi K3 的 88.3——终端环境下的端到端任务执行,Beam 紧咬 GLM-5.2,但离第一梯队(DeepSeek/Kimi)还有距离。
  • SWE-bench Pro v1:65.5,对比 GLM-5.2 的 62.1——更难的专业版编程基准,Beam 反超。

诚实地说,这份成绩单是"有输有赢":官方自己的表格也显示,GLM-5.3 和 Kimi K3 在双方都有分数的大部分测试上仍然领先 Beam。所以准确的表述是:Beam 达到了中国顶级开放模型 GLM-5.2 的同一档位,但并没有超越它们。这和昨天 Bloomberg Intelligence 那份"中美顶尖模型差距只剩 3%"的报告是互相印证的——西方的开放模型正在追,但还没有反超。

开放权重模型正在成为 AI 竞赛的第二战场

四、真正的卖点:不是跑分,是"每 token 成本"

如果只看跑分,Beam 只是"又一个 GLM-5.2 级别"的模型。但 Reflection 真正想讲的故事是效率:官方称达到同等推理质量,Beam 的推理算力只有西方同类开放模型的 1/3 到 1/4。

为什么这对用模型的人更重要?因为开放权重的成本公式是:成本 = 算力 + 运维,权重本身免费。推理算力砍到 1/3,意味着:

  • 同一张卡能跑更多并发,自建推理服务的单 token 成本直接下降;
  • 激活参数 23B 意味着更低的显存门槛,中小团队租得起卡来跑;
  • 中转网关拿到权重后,API 定价有更大的下调空间——过去一年 DeepSeek 和 Qwen 就是这么把西方 API 价格打下来的。

不过要给这个"省算力"主张打两个补丁(来自 RuntimeWire 的核查):第一,官方的效率估算用的是基准测试数据推算,排除了 prompt 预填充、长上下文注意力计算和 serving 开销,这是模型算力对比,不是你实际部署时的账单;第二,分数本身还没法独立验证,一切等 10 月权重落地、社区跑分之后再下结论。

五、公司与算力背景:一家"含着金钥匙"的初创公司

理解 Beam 的来头,有助于判断它后续的持续投入能力:

  • 创始人:Misha Laskin(CEO)与 Ioannis Antonoglou,两名前 Google DeepMind 研究员,后者是 DeepMind 历史上第六位研究员、参与过 AlphaGo。公司 2024 年创立于纽约布鲁克林。
  • 融资:据 PitchBook 数据已累计融资约 47 亿美元,投资方包括英伟达、红杉、Lightspeed;最新一轮投前估值 250 亿美元(CNBC 报道)。《华尔街日报》称其为"西方的 DeepSeek"。
  • 算力锁仓:今年夏天与 SpaceX(Colossus 2 数据中心)、Nebius 签下合计超 70 亿美元的算力协议,确保用到 2029 年的 GB300 供应。训练 Beam 的 10500 块 GB300 就是这么来的。
  • 商业路线:主打"AI 工厂"概念——帮企业和主权国家用自有数据定制本地 AI 系统,已在韩国与新世界(Shinsegae)集团试点主权 AI 合作。发布时将通过 hyperscaler(大型云厂商)和 neocloud 分发,并接入主流开源推理库。

开放权重正在成为主流模型分发层

六、对用模型的人:三条行动建议

  1. 等权重,不等评测:10 月权重按 Apache 2.0 放出后,第一时间看社区复现的独立跑分(SWE-bench、Terminal-Bench 都有公开 harness)。Apache 2.0 是商用友好的许可证,允许微调和再分发——对比之下 Kimi K3 的定制 license 对超大产品有署名要求,选型时要看清。
  2. 代码/Agent 场景可以开始做技术预研:如果你现在的代码助手跑的是 DeepSeek V4.1 Flash 或 Qwen,Beam 落地后值得做一次 A/B——它的差异化不在绝对分数,而在"同等质量下更低的推理成本",这对高频调用的代码补全、Agent 循环场景直接等于省钱。
  3. 纯文本是边界:Beam 明确是 text-only,不做图像输入。多模态需求继续看 Kimi K3、Inkling 这类模型;别指望一个模型包打天下——这也呼应我们之前写过的"多模型分工"趋势。

权重落地后的典型本地部署姿势(示例,vLLM):

终端命令
# Beam 权重发布后(Apache 2.0),可用 vLLM 等推理框架本地部署
vllm serve reflection-ai/beam \
  --tensor-parallel-size 8 \
  --max-model-len 1000000

社区反响方面,Beam 公告在 Hacker News 上获得了 80+ points、20+ 条讨论,官方发布的六项基准对比信息图也在 Threads 等社区广泛传播——讨论焦点集中在"西方终于有能打的开放权重代码模型"和官方数据的可信度上,观点两极但热度真实。

一句话总结

Beam 不是来"屠榜"的,它是来"压价"的:用 GLM-5.2 同档的推理代码能力、1/3 的推理算力、Apache 2.0 的开放权重,给开放模型市场再添一个高性价比选项——10 月权重落地见真章,在此之前所有分数先打七折看。


来源

  • Reuters: Nvidia-backed Reflection unveils first AI model to take on Chinese open models — https://www.reuters.com/technology/nvidia-backed-reflection-unveils-first-ai-model-take-chinese-open-models-2026-10-05/
  • TechCrunch: Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute cost — https://techcrunch.com/2026/10/05/reflection-debuts-beam-a-open-weight-ai-model-to-rival-chinese-models-at-lower-compute-cost/
  • MarkTechPost: Reflection AI Introduces Beam: A 501B Open-Weight MoE Model With 23B Active Parameters — https://www.marktechpost.com/2026/10/05/reflection-ai-introduces-beam-a-501b-open-weight-moe-model-with-23b-active-parameters-for-coding-and-agentic-workloads/
  • RuntimeWire: Reflection publishes Beam benchmark scores ahead of its weight release — https://runtimewire.com/article/reflection-ai-beam-open-weight-model
  • AI Stock Wire: Reflection unveils Beam open-weight AI model (FAQ) — https://aistockwire.com/blog/reflection-ai-beam-open-weight-model-nvidia-nvda-kimi-glm-benchmarks-october-2026
  • Startup Fortune: Reflection AI launches Beam, an open model it says beats the West on efficiency — https://startupfortune.com/reflection-ai-launches-beam-an-open-model-it-says-beats-the-west-on-efficiency/

*注:本文所有基准分数均为 Reflection 官方公布,尚未经第三方独立验证;效率主张的测算口径说明见正文。*