「西方的 DeepSeek」本月登场:Reflection 首款开放权重模型将发布,中美顶尖模型差距只剩 3%
十月正在变成「开放模型月」:开放权重之战对用模型的人全是好消息——更多选择、更低价格、数据不出内网。
「西方的 DeepSeek」本月登场:Reflection 首款开放权重模型将发布,中美顶尖模型差距只剩 3%
结论:先看这几条
- Axios 10 月 4 日独家爆料:英伟达背书的初创公司 Reflection AI 将在本月发布首款开放权重模型;不止它一家,本月多家西方公司都计划推出开放权重模型,直接对标中国开源模型(DeepSeek、Qwen)。
- 重要澄清:截至 10 月 5 日,Reflection 的模型尚未正式发布——没有模型名、没有权重、没有许可证、没有评测分数。部分聚合新闻写成"已发布"属于误读。
- 同一天的另一份报告:Bloomberg Intelligence 高级分析师 Robert Lea 称,中美顶尖 AI 模型在 LiveBench 上的分数差距已降至历史最低的 3%(年初约 15%,5 月约 9%)。DeepSeek 9 月发布的 V4.1 Flash 以 81.1 分逼近 Anthropic 最高分模型的 83.4 分。
- 对用模型的人意味着什么:开放权重 = 可本地部署、可微调、数据不出内网;供给端竞争加剧 = API 和中转价格继续下探。DeepSeek V4.1 Flash 官方 API 非高峰时段仅 $0.15 / $0.60 每百万 token,权重还按 MIT 协议开源。
- 行动建议:别干等 Reflection,先把自己的评测集和部署管线搭好;注意"开放权重 ≠ 开源",商用前务必看清许可证是否允许微调和再分发。
一、爆料了什么:Reflection 本月发布首款开放权重模型
据 Axios 记者 Bradley Olson 当地时间 10 月 4 日的独家报道,多位消息人士透露,本月将有多家西方企业推出开放权重 AI 模型,其中最受关注的是 Reflection AI 的首款模型。报道称,这款模型的定位是"美国版的开放权重答案",预期最初会落后于美国最先进的闭源模型,但足以同中国友商的顶级开放权重模型相竞争。
Reflection 是什么来头?这家 2024 年 3 月创立于纽约的初创公司,由两名前 Google DeepMind 研究员 Misha Laskin(CEO) 和 Ioannis Antonoglou 联合创办——后者是 DeepMind 历史上第六位研究员,曾参与 AlphaGo 的研发。资本层面,它去年 10 月完成 20 亿美元融资、估值 80 亿美元,领投方包括英伟达;另据报道,英伟达此前还单独向其注资 8 亿美元。《华尔街日报》曾称它为 "DeepSeek of the West"(西方的 DeepSeek)。
为准备这次发布,Reflection 近期持续与华盛顿方面沟通,并大举锁定算力:报道称其承诺到 2029 年的算力投入超过 70 亿美元,包括从今年 7 月起每月向 SpaceX 的 Colossus 集群支付约 1.5 亿美元、租用英伟达 GB300 芯片。对一家尚未发布旗舰模型的公司来说,这个下注力度本身就说明了开放权重赛道的分量。
开放权重模型的一大好处是支持客户本地部署——这对微调和推理数据安全有严格要求的银行、国防等机构是关键卖点。换句话说,Reflection 打的不是"又一个聊天机器人",而是"企业可私有化部署的顶级开放模型"这张牌。目前 Reflection 发言人拒绝置评,模型细节仍是未知数。
再次强调:这是一次"即将发布"的爆料,不是发布本身。在权重真正落地、许可证公布、第三方评测跑出分数之前,任何关于它"多强"的具体说法都不可信。
二、为什么"开放权重"正在成为第二战场
过去一年,AI 竞赛的主战场是闭源旗舰模型(GPT、Claude、Gemini)的榜单之争。但另一条战线正在成型:开放权重模型的军备竞赛。
逻辑很简单。对开发者和企业用户来说,开放权重意味着三件事:
- 数据主权:模型可以跑在自己的机房里,敏感数据不用流向第三方云;
- 可微调、可蒸馏:能用私有数据定制,做出真正贴合业务的版本;
- 成本结构变化:权重免费,成本只剩算力——这直接压低了"用一个好模型"的门槛。
而中国厂商已经在这条战线上证明了模式:DeepSeek R1 按 MIT 协议开源、Qwen 系列持续放出高性能权重,逼得全球中转网关和 API 供应商不断调低价格。现在美国资本也要下场做同样的事:当"西方的 DeepSeek"真的到来,开放权重供给将翻倍,用户手里的选择会变多,价格的天花板会被进一步压低。
| 维度 | 闭源 API 模型 | 开放权重模型 |
|---|---|---|
| 获取方式 | 按 token 付费调用 | 免费下载权重,自备算力运行 |
| 数据隐私 | 数据需发送到厂商云端 | 可完全本地部署,数据不出内网 |
| 定制能力 | 仅限厂商提供的微调接口 | 可自由微调、蒸馏、魔改 |
| 成本结构 | 按量付费,价格由厂商定 | 权重零成本,成本 = 算力 + 运维 |
| 典型代表 | GPT-6 系列、Claude、Gemini 4 Argon | DeepSeek V4.1 Flash、Qwen、GLM、即将发布的 Reflection |
三、背景板:中美顶尖模型差距缩至 3%,DeepSeek V4.1 Flash 逼近 Anthropic
理解 Reflection 为什么选在这个时间点发布,要看同一天出炉的另一份报告。
Bloomberg Intelligence 高级分析师 Robert Lea 在本周发布的报告中指出:中国顶尖 AI 模型与美国竞争模型在基准测试中的分数差距,已从今年初的约 15%、5 月的约 9%,进一步缩小到仅 3%——历史最低点。直接触发这次收窄的是 DeepSeek 9 月发布的 V4.1 Flash。
具体数字来自 LiveBench(一个以实际任务能力评测模型的公开基准):
| 模型 | LiveBench 总分 | 备注 |
|---|---|---|
| Anthropic Claude Fable 5.1(Max Effort) | 83.4 | 美国最高分 |
| DeepSeek V4.1 Flash(Max Effort) | 81.1 | 差距 2.3 分,约 2.8% |
这让 DeepSeek V4.1 Flash 拿下 LiveBench 全球第 6,创下中国模型在该榜单上的最佳名次。更值得注意的是细分项:在 agentic coding(智能体编程)上,DeepSeek 拿到 77.3 分,反超 Claude Fable 5.1 的 66.1 分。
当然,冷静的注脚也不能少:目前 LiveBench 前 15 名中,来自中国的模型只有 3 款,美国在高阶模型的数量上仍占优;而且单纯比较榜单分数,不能完全反映商业竞争力。分析师也提醒,中国模型还面临蒸馏指控带来的监管压力,部分模型可能受到美国进一步审查。但趋势本身是清晰的:"美国断代领先"的叙事,在数据面前越来越站不住脚——这正是 Reflection 必须在开放权重上做出回应的大背景。
四、价格视角:开放模型如何改变你的账单
本站是价格追踪工具,所以最后算一笔账。开放权重的竞争,最先传导到的就是价格。
DeepSeek V4.1 Flash 的官方 API 定价(2026 年 9 月 10 日上线,模型名 deepseek-flash):
| 每百万 token | 非高峰 | 高峰 |
|---|---|---|
| 输入(cache 未命中) | $0.15 | $0.30 |
| 输出 | $0.60 | $1.20 |
| 输入(cache 命中) | $0.003 | $0.006 |
几点解读:
- 升级附带降价:V4.1 Flash 全面替代 V4 Flash,价格还比前代更低——DeepSeek 一贯的"加量还降价"打法。
- 缓存是省钱关键:cache 命中价是未命中的 1/50。凡是有固定 system prompt 或重复文档上下文的工作流,优先围绕缓存设计。
- 竞争者也在卷:OpenAI 的 GPT-6 Luna 定价 $0.10 / $0.50(输入/输出),输入端比 V4.1 Flash 非高峰价还低三分之一;Google 刚发布的 Gemini 4 Argon 定价 $2 / $10,约为 Claude Opus 5.5 的一半。全行业的价格锚都在下移。
对中转/网关用户来说,开放权重还有一层意义:权重 MIT 开源意味着任何网关都可以自行部署、不受官方 API 配额和峰谷定价限制。供给越多,网关之间的价格战越激烈,最终受益的是调用方。
如果你现在就想用 V4.1 Flash,官方 API 是 OpenAI 兼容接口,切换通常只是一行配置:
# 之前:model="deepseek-v4-flash"
# 现在:V4 Flash 已退役,旧名称会自动指向 V4.1 Flash,
# 但建议显式写新名称,日志里才对得上
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-flash", # DeepSeek V4.1 Flash
messages=[{"role": "user", "content": "用 Python 写一个快速排序"}],
)本地部署派注意:V4.1 Flash 是 552B 参数的 MoE(prefill 激活 8B、decode 激活 16B),FP8 权重约 510GB,实际需要 8 卡节点(8×H200 或 8×B200/B300 起步)。"权重免费"不等于"运行免费",先算好算力账。
五、用户现在该做什么
- 别干等 Reflection:模型还没发布,没有权重、没有评测。现在就把自己的评测集和 serving 管线搭好(用现有的 Qwen、DeepSeek 版本先跑通),等权重一落地当天就能实测对比,而不是从零开始。
- 看许可证,不看口号:"开放权重"不等于"开源"。Reflection 的许可证还没公布,上线前务必确认是否允许商用、是否允许用私有数据微调、是否允许再分发——这三条有一条卡住,企业级应用就无从谈起。
- 中转用户盯上架节奏:新开放模型通常先上官方 API,再进各家网关。V4.1 Flash 这类"官方降价 + 权重开源"的组合出现时,往往是网关调价的前兆,提前关注能吃到第一波红利。
- 成本敏感型工作流先吃缓存红利:V4.1 Flash 的 cache 命中价 $0.003,比 OpenAI Luna 的 $0.01 还低。固定 prompt 的场景,现在就可以做缓存优化,不用等任何新模型。
一句话总结
十月正在变成"开放模型月":美国终于有人认真做 DeepSeek 式的开放权重,而中国模型已经把差距追到 3%——供给翻倍、价格下探、数据可私有化,对用模型的人来说,这全是好消息。
来源
- Axios 独家爆料(经 IT 之家 / 新浪财经转述):https://finance.sina.cn/stock/jdts/2026-10-05/detail-iniucuem9748100.d.html
- Reflection 发布前瞻与事实核查(explainx.ai):https://explainx.ai/blog/reflection-ai-open-weight-model-us-answer-deepseek-qwen-october-2026
- Reflection 与 SpaceX 算力协议(ZeroHedge):https://www.zerohedge.com/ai/deepseek-west-reflection-inks-major-compute-deal-spacexai
- Reflection 20 亿美元融资背景(TFN):https://techfundingnews.com/deepmind-alums-reflection-ai-snaps-2b-at-8b-valuation-to-challenge-deepseek-meta-and-mistral/
- Bloomberg Intelligence"3% 差距"报告(implicator.ai 整理):https://www.implicator.ai/deepseek-us-ai-benchmark-gap-3-percent/
- BI 报告(Bloomberg Law):https://news.bloomberglaw.com/artificial-intelligence/us-lead-in-ai-over-china-narrows-after-deepseek-gains-bi-says
- 中美 AI 差距报道(工商时报):https://www.ctee.com.tw/news/20261005700764-430702
- DeepSeek V4.1 Flash 定价与规格(Yotta Labs):https://www.yottalabs.ai/post/deepseek-v4-1-flash-pricing-specs-v4-pro-routing-2026
- Gemini 4 Argon 定价与模型时间线(TechPP):https://techpp.com/roundup/ai-model-launch-timeline/