「Carbon」追赶 Claude,对手的模型也来打工:Google 这周干了两件大事
泄漏的 Carbon 在实验室追 Claude,发布的 Gemini agent 把 Claude 拉来打工
「Carbon」追赶 Claude,对手的模型也来打工:Google 这周干了两件大事
要点先行:
- 泄漏线:10 月 9 日,Business Insider 报道 Google 员工正在内部测试代号为「Carbon」的 Gemini 4 新版本。一名员工称它的编程体验「像 Claude Opus 5.5」,另一名直接在内频说「Carbon is really good!」。Google 拒绝置评,它可能作为 Argon 的更新发布,也可能永远不会公开。
- 发布线:10 月 8 日,Google Cloud 在「Gemini at Work 2026」大会上推出统一办公 AI 代理「Gemini agent」。最大卖点:模型无关——每个任务自动挑选最合适的模型,首发阵容是自家 Gemini + 对手 Anthropic 的 Claude。
- 数字同事:agent 还可以拥有自己的 Workspace 账号、邮箱、日历和 Drive,只看得到团队明确分享给它的信息。管理员还能在账单控制台给它设定「工资帽」。
- 用户视角:Argon 官方基准漂亮但内部员工对编程实测体感有保留(彭博此前报道);Carbon 泄漏说明 Google 还在加码追赶。agent 的跨模型路由 + 成本控制,正是企业 AI 采购降本的关键能力。

泄漏的「Carbon」:Google 内部在测的下一个 Gemini 4
故事的源头是 Business Insider 在 10 月 9 日的报道(该社自己的 LinkedIn 与 Threads 账号也同步推送了这条新闻)。据该报道看到的文件和截图,Google 最近几天通过内部编码平台 Jetski 向员工分发了一个新的 Gemini 4 版本,代号 Carbon。
两个细节值得注意:
- 一名员工告诉 BI,Carbon 在编程上的感觉「像 Opus 5.5」——指的是 Anthropic 专为长时程 agentic coding 打造的最强模型。说这话的同时他也打了补丁:「还需要更多测试」。
- 另一名员工在内部频道里更直接:「Carbon is really good!」
Google 对此拒绝置评。BI 也无法确认 Carbon 最终会作为 Argon 的一次更新发布,还是作为独立的 Gemini 4 模型——甚至「Google 可能永远不会公开发布它」。
但这条泄漏并非孤证。同一天,testingcatalog 发现 Google 自家的 AI 编程工具 Antigravity 2.0 Insiders 的模型选择器里已经出现了 Argon 的身影,附带三个上下文档位:默认 256K、512K(约消耗 1.3 倍 quota/轮)、900K(约消耗 1.8 倍 quota/轮)。这些档位形制与现有 Gemini Flash 模型类似,暗示 Google 已经在为 Argon 系列设计阶梯式的上下文计费。同一版本里还出现了 Gemini Web 的低/中/高三档「思考力度」开关,以及一个此前叫 Concierge、现在改名 Chief of Staff 的新 agent 功能——说明 Google 正在为 Gemini 4 的上架做产品层面的铺垫。
另外,BI 报道中提到的一份内部文档显示,被选中成为公开版 Argon 的 checkpoint 代号是 「Barium-B」,而 Carbon 是另一个、可能更强的迭代。换句话说:Google 手里至少有两套 Gemini 4 的牌,公开的 Argon 只是其中一张。

官方的 Argon:基准很漂亮,员工体感有保留
要理解 Carbon 为什么重要,得先看它的前任。Google 在 9 月 30 日发布了 Gemini 4 Argon,定位是长时程推理:复杂编程、法律金融研究、网络安全防御。发布策略相当克制——先给 Fairwind Program 的可信网络安全防御者,再给美国政府的自愿预发布计划,付费 API 客户和 Google AI Ultra 订阅用户「随后」,但至今没给日期。换句话说,Argon 发布十天了,公众依然用不上。
官方给出的基准数字确实亮眼(均为 Google 单方披露):
| 评测 | Gemini 4 Argon | 对手 |
|---|---|---|
| DeepSWE v1.1(长时程软件工程) | 77.9%(官方称 SOTA) | Claude Opus 5.5:74.2% |
| Harvey Legal Agent Benchmark(法律) | 19.6% | GPT-6 Astra:5.4% |
| AutomationBench(自动化) | 51.3% | Claude Opus 5.5:42.5% |
| 综合 | 18 项披露基准中 13 项领先或持平 GPT-6 Astra / Claude Opus 5.5 | — |
| FrontierSWE v2 | 落后 | GPT-6 Astra 领先 10.5 分 |
| Terminal-bench 4.0 | 落后 | Claude Opus 5.5 领先 9 分 |
Google 还讲了几个内部实战故事:Argon agent 帮公司把超过 80 万行 C/C++ 代码(包括 Fuchsia 系统的 Zircon 内核)迁移到 Rust;在一个 libgav1(开源视频解码库)案例里,模型通过反复的 profile-guided 实验替换了 3.2 万行性能关键代码,Google 称结果比现有 Rust 移植版本快 2.7 倍且输出完全一致——当然,这些大规模重写在上线前都经过严格的自动化加人工审计。
但硬币的另一面:彭博社此前报道,Google 内部对 Argon 的实际编程能力存在质疑——基准上好看,员工真正用起来处理某些编码任务时却吃力。Google 官方回应称「说 Gemini 4 在编程等领域表现不佳是不准确的」,DeepMind 负责人 Koray Kavukcuoglu 也表示对团队「完全信任」。
这正是 AI Price Memory 一贯提醒读者的:官方基准是 claim(主张),不是 measurement(测量)。Argon 的所有分数目前都来自第一方或受限测试群体。Carbon 泄漏的真正信息量在于——连 Google 自己的员工都觉得,公开版 Argon 的编程能力还没追上 Claude Opus 5.5,所以内部已经在测「下一个」。
Gemini agent:一个助理,用谁家模型看任务
模型线的另一边,Google 在产品线上走了一步让所有人都意外的棋。
10 月 8 日,Google Cloud CEO Thomas Kurian 在「Gemini at Work 2026」大会上宣布推出 Gemini agent:面向工作的统一 AI 代理。路透社、AbsoluteGeeks 等多家媒体确认了以下要点:
- 一个入口:问答、写文档、生成媒体、执行任务、写代码,全都在一个 prompt 框 + 一个 API 里完成。你给的是「目标」而不是「指令」,agent 自己规划步骤、挑选工具和技能,最后在你工作的工具里交出成品。
- 云端常驻:agent 跑在云上,手机、桌面、命令行、Workspace、Microsoft 365、Slack 之间记忆统一;长任务可以生成临时子代理并行或串行处理,合上笔记本电脑后任务照样跑。
- 模型无关(model-agnostic):这是全场最大的「叛逆」。每个任务由系统自动挑选最合适的模型,首发阵容是 Google 自家 Gemini 系列 + Anthropic 的 Claude,未来还会加入更多。OpenAI 的 Dots agent 只用自家模型,Copilot 绑定自家合作模型,Anthropic 的方案只用 Claude——只有 Google 说「不用把整个 agent 劳动力押在一家实验室身上」。
- 成本控制:内置开支上限,管理员可以在 Cloud Billing Console 里给项目设定 AI 花费封顶。考虑到 Kurian 在大会上提到 token 价格自 2024 年以来下降了 98%,路由对了就是实打实的省钱。

「数字同事」:有了邮箱、日历和工资帽的 agent
比模型路由更抓眼球的,是 coworker agent(同事型 agent) 这个概念:你描述一个岗位,Gemini 就创建一个拥有自己 Workspace 账号的 agent——独立的邮箱地址、日历、Drive 存储,在公司通讯录里占一个席位(据报道地址形如 @agents.company.com)。同事可以把它拉进 Chat 频道、在文档评论里 @ 它,它的编辑会以它自己的名字出现在版本历史里。
权限设计上 Google 做了个聪明的切割:coworker agent 只能看到团队明确分享给它的信息,以自己的身份行动而不是冒用你的身份。行业版本也在路上:金融服务和法律版已进入预览,政府、医疗、零售版随后。
目前价格和正式 GA 日期都还没公布,处于 private preview 阶段,计划先向部分 Workspace Business / Enterprise 客户开放。对标一下:微软 365 Copilot 的公开标价是每用户每年 360 美元,Google 这次连价格都不谈,显然还在观察企业买单意愿。
对用模型的人,这意味着什么
- 开发者:盯紧 Antigravity 里 Argon 的上下文档位(512K≈1.3x、900K≈1.8x quota/轮)。这基本是 Google 在为长上下文定价做 A/B 测试,正式 API 价格大概率沿用这套阶梯。Carbon 若真达到「Opus 5.5 级编程」,Google 在代码场景的 API 性价比可能重塑——但在它公开发布之前,一切只是传闻。
- 企业采购/Workspace 用户:Gemini agent 的「跨模型路由 + 开支上限」组合,是 2026 年企业 AI 采购清单上的标准答案:不再赌单一模型,而是让系统按任务选最便宜够用的模型。SemiAnalysis 此前实测 Claude 中端订阅的 API 等值价值约 5 倍于 ChatGPT 同档——路由层的存在就是为了吃掉这种价差。
- 订阅用户:Google AI Ultra 订阅者是 Argon 公开后的第一批候选人,但 Google 连日期都没给,别为传闻提前续费。agent 目前只面向企业,个人用户还得等。
- 风险提示:Carbon 是泄漏消息,BI 明确说它可能永远不发布;agent 的价格和 GA 日期未知。两条线都处在「看得到、摸不着」的阶段,决策上按「观察」处理即可。
一句话总结:Google 这周左手在实验室里追 Claude(Carbon),右手在市场上把 Claude 拉来给自己打工(Gemini agent)——模型竞赛的下半场,拼的不只是谁的模型更强,还有谁更敢于「用对手的模型服务自己的用户」。
来源
- Business Insider 报道(经 AIStockWire 整理):Google 员工内测 Gemini 4「Carbon」,编程体验被比作 Claude Opus 5.5 —— https://aistockwire.com/blog/google-gemini-4-carbon-googl-employees-claude-opus-argon-october-2026
- TestingCatalog:Antigravity 2.0 Insiders 出现 Argon 模型选项与上下文档位 —— https://www.testingcatalog.com/gemini-4-argon-hints-emerge-as-google-tests-carbon-checkpoint/
- Writingmate:10 月第一周 AI 新闻汇总(Gemini 4 Argon 基准与定价) —— https://writingmate.ai/blog/ai-news-week-of-2026-10-05
- 路透社:Google Cloud 推出面向工作的 Gemini agent(2026-10-08) —— https://www.reuters.com/business/google-cloud-introduces-gemini-agent-work-ai-race-heats-up-2026-10-08/
- AbsoluteGeeks:Gemini agent 详解(统一入口、子代理、coworker agent) —— https://www.absolutegeeks.com/tech-news/google-just-gave-ai-agents-their-own-email-addresses-and-calendars/
- TechFeatured:Gemini agent 的模型无关路由 —— https://techfeatured.com/20312/google-gemini-agent-universal-ai-agent-work-runs-claude
- AIWeekly:coworker agent 的邮箱、日历与开支上限 —— https://aiweekly.co/alerts/google-clouds-gemini-agent-gets-a-mailbox-and-directory-seat
- Shashi Bellamkonda:Gemini agent 发布解读(含 Kurian 大会数据) —— https://www.shashi.co/2026/10/googles-new-gemini-ai-agent-gets-its.html
- 彭博社(经 Nestia 转载):Google 员工对 Gemini 4 编程能力的内部质疑 —— https://news.nestia.com/detail_share/14183655?media_type=1