很多人已经习惯用 Claude Code 写代码了,但真正决定「体验上限」的,其实是背后接的模型。
这篇文章的目标是两件事:

  • 说明:为什么我会在本地开发里优先选择 Gemini 3 Pro,而不是只用默认的 Claude / GPT;
  • 实战:手把手演示如何通过 TokHub 把 gemini-3-pro-preview 接到 Claude Code 里使用

文中所有关于 Gemini 3 的性能数据,均来自 Google DeepMind 官方 Gemini 3 模型页面https://deepmind.google/models/gemini/),并在下文中用表格形式整理,方便你快速判断「值不值得折腾」。

提示:本文偏向「实战+选型」,适合已经在用 Claude Code,想进一步把 Gemini 3 纳入日常开发工作流的同学。

一、为什么要用 Gemini 3?

1. 官方定位:当前最智能的 Gemini 模型

根据 Google DeepMind 官方介绍:

  • Gemini 1:解决了「多模态 + 长上下文」;
  • Gemini 2:在「推理、思考、工具调用」上进入 agent 时代;
  • Gemini 3:把这些能力真正合在一起,强调「帮你学习、构建、规划任何事情」。

在产品形态上,目前主要有三条线:

  • Gemini 3 Pro:适合复杂任务与高价值代码/项目;
  • Gemini 2.5 Flash / Flash-Lite:偏向高吞吐、日常任务与成本敏感场景;
  • 以及围绕前端体验的 Google Antigravity / AI Studio 等开发者工具。

对开发者而言,最直接的问题是:它相对 Claude / GPT 到底强在哪里?

2. 来自官方的硬核对比数据

下面这组数据来自 Google DeepMind 官方 Gemini 3 页面中公开的基准测试表,横向对比了 Gemini 3 Pro、Gemini 2.5 Pro、Claude Sonnet 4.5 和 GPT-5.1(只摘出对开发者很关键的几项):

数据来源:Google DeepMind – Gemini 3 模型介绍
链接:https://deepmind.google/models/gemini/

基准项目场景说明Gemini 3 ProGemini 2.5 ProClaude Sonnet 4.5GPT-5.1
Humanity’s Last Exam学术推理,无工具37.5%21.6%13.7%26.5%
ARC-AGI-2视觉推理谜题31.1%4.9%13.6%17.6%
GPQA Diamond高难度科学知识91.9%86.4%83.4%88.1%
AIME 2025高难数学,无工具95.0%88.0%87.0%94.0%
MMMU-Pro多模态理解与推理81.0%68.0%68.0%76.0%
ScreenSpot-Pro屏幕理解与操作72.7%11.4%36.2%3.5%
Video-MMMU视频理解与知识获取87.6%83.6%77.8%80.4%
LiveCodeBench Pro代码题 Elo(越高越好)2439177514182243
Terminal-Bench 2.0终端 Agent 编码成功率54.2%32.6%42.8%47.6%
SWE-Bench Verified真实项目修 Bug(单次尝试)76.2%59.6%77.2%76.3%
MRCR v2 (8-needle) 128k长上下文检索77.0%58.0%47.1%61.6%
MRCR v2 1M100 万 Token 级上下文26.3%16.4%不支持不支持

简单解读几条对开发者特别关键的指标:

  • 代码 & Agent 能力

    • LiveCodeBench ProTerminal-Bench 2.0SWE-Bench Verified 这几项结合起来,可以视为「写代码 + 用工具 + 跑长流程」的综合能力。
    • Gemini 3 Pro 在 Agent 相关基准上,通常 略高于 GPT-5.1,也明显领先于 Claude Sonnet 4.5
  • 多模态 + 屏幕理解

    • ScreenSpot-Pro 上,Gemini 3 Pro 得分 72.7%,而 Gemini 2.5 Pro 只有 11.4%、GPT-5.1 只有 3.5%。这意味着它在「看一张界面图/截图,然后帮你操作」这一类任务上有明显优势。
  • 长上下文能力

    • MRCR v2 的 128k / 1M 上下文测试中,Gemini 3 Pro 对长文档、长代码库的整体理解与检索能力显著优于 2.5 代和其他模型——这对使用 Claude Code 做「整仓重构、跨项目重构」非常关键。

如果把这些指标翻译成一句话:

当你需要一个「既能写代码、又能看多模态输入、还能长时间当 Agent」的模型时,Gemini 3 Pro 是目前 DeepMind 官方给出的最强组合。

接下来我们就用这个模型来给 Claude Code「换引擎」。

二、整体方案:用 TokHub 把 Gemini 3 接到 Claude Code

Claude Code 原生是走 Anthropic 自家的 API,但它同时支持通过环境变量 / 配置来换成兼容的上游服务
TokHub 做的事情,就是:

  • 暴露一个 Anthropic 兼容的 API 网关(Base URL);
  • 在后台帮你把请求转发到指定模型,比如 gemini-3-pro-preview
  • 你在本地只需要改一下环境变量或 ~/.claude/settings.json

整体步骤可以概括为:

  1. 注册 TokHub,拿到 API Key;
  2. 设置环境变量或修改 ~/.claude/settings.json
  3. 启动 Claude Code,使用 /model 切到 opus(被映射为 Gemini 3 Pro);
  4. 在真实项目里验证体验与效果。

下面按步骤展开。

三、步骤一:注册 TokHub 账号并获取 Token

注:本节参考了 Ctok 官方「体验 Gemini 3 + Claude Code 教程」页面内容,并结合本文场景做了整理。

  1. 打开注册页面:
  2. 完成邮箱验证、登录后台后,访问 Token 控制台:
  3. 创建一个新的 API Key,并记录下来(后面会写入环境变量或配置文件中)。

建议:

  • 专门为 Claude Code 创建一个独立的 Key,方便后续在控制台里区分使用场景与配额;
  • 保存好 Key,不要提交到 Git 仓库,可以借助本地环境变量或 .env 工具来管理。

四、步骤二:用环境变量启动 Claude Code(最快速)

如果你只是想先快速体验一下 Gemini 3 + Claude Code 的组合,推荐直接用环境变量启动。

在终端中执行:

export ANTHROPIC_AUTH_TOKEN="你的_tokhub_key"
export ANTHROPIC_BASE_URL="https://tokhub.ai"
export CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC="1"

# 按需配置默认模型
export ANTHROPIC_DEFAULT_HAIKU_MODEL="claude-haiku-4-5-20251001"
export ANTHROPIC_DEFAULT_SONNET_MODEL="claude-sonnet-4-5-20250929"
export ANTHROPIC_DEFAULT_OPUS_MODEL="gemini-3-pro-preview"

# 启动 Claude Code CLI
claude

说明:

  • ANTHROPIC_AUTH_TOKEN:填 TokHub 控制台里生成的 API Key;
  • ANTHROPIC_BASE_URL:请求走 TokHub 网关,由它转发到 Gemini 3;
  • CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1:关闭非必要网络请求,提升隐私与可控性;
  • ANTHROPIC_DEFAULT_OPUS_MODEL关键点,这里把原本的 Opus 型号替换成 gemini-3-pro-preview,后面在 Claude Code 里用 /model opus 就等价于「切到 Gemini 3 Pro」。

启动成功后,在 Claude Code 的对话框里输入:

/model opus

Claude Code 就会切换到映射后的 Gemini 3 Pro 通道。你可以先给它一个熟悉的项目,让它做一次「从零解释 + 重构建议」,感受一下与之前模型的差别。

五、步骤三:写入 ~/.claude/settings.json(长期使用推荐)

如果你已经确定要长期使用 TokHub + Gemini 3 组合,建议把配置写入 ~/.claude/settings.json,避免每次都手动 export。

示例配置片段如下(只展示与环境变量相关部分):

{
  "env": {
    "ANTHROPIC_AUTH_TOKEN": "你的_tokhub_key",
    "ANTHROPIC_BASE_URL": "https://tokhub.ai",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "claude-haiku-4-5-20251001",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "claude-sonnet-4-5-20250929",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "gemini-3-pro-preview"
  }
}

修改完成后:

  1. 退出当前 Claude Code 会话;
  2. 重新在终端中执行 claude 启动;
  3. 再次用 /model opus 切换模型,确认已走 TokHub + Gemini 3 通道。

如果想临时切回 Anthropic 官方通道,可以新开一个终端,不带上述环境变量启动,或者在 settings.json 中维护多个 profile,根据需要切换。

六、在 Claude Code 里用 Gemini 3 的几条实战建议

单纯「能跑起来」只是第一步,更关键的是:怎么用才不浪费 Gemini 3 的能力和额度。结合上面的官方数据和日常体验,可以给出几条实用建议:

1. 把 Gemini 3 Pro 用在「高价值任务」

从基准测试看,Gemini 3 Pro 在:

  • 高难推理(Humanity’s Last Exam、AIME 2025);
  • Agent 式长流程任务(Terminal-Bench、SWE-Bench、τ2-bench);
  • 长上下文处理(MRCR v2 128k / 1M);

都有明显优势。建议优先用于:

  • 大型重构(跨多个子仓 / 多语言混合项目);
  • 对业务正确性要求很高的模块(例如结算、权限、风控);
  • 需要持续「看文档 + 看代码 + 用工具」的长对话会话。

一些简单的「写个小脚本」「改一行配置」类任务,完全可以仍然交给更便宜的 2.5 Flash / Haiku 模型。

2. 善用多模态能力:截图 + 日志一起丢

有了 ScreenSpot-Pro、Video-MMMU 等指标背书,你可以放心地在 Claude Code 里这样用 Gemini 3:

  • 直接把 终端截图、浏览器 DevTools 截图、监控图 和代码一起丢进去,让它帮你诊断;
  • 把复杂的性能监控图表(Prometheus、Grafana)截图给它,让它解释瓶颈所在。

这种多模态输入在很多时候比你「描述半天环境」更高效。

3. 利用长上下文做「整仓级别的理解」

借助 MRCR v2 相关数据,可以放心让 Gemini 3 Pro:

  • 扫一次整个服务仓库,让它输出高层架构图与依赖关系说明;
  • 在大项目里做「从需求→设计→实现→测试」的一致性检查;
  • 帮你找「同一业务逻辑在多个服务中的重复实现或不一致实现」。

实践上,可以把这个操作封装成几个复用 Prompt 模板,让 Claude Code 充当一名「资深代码审查员」。

总结:什么时候值得切到 Gemini 3?

综合 DeepMind 官方数据和实际体验,我会这样推荐使用 Gemini 3 + Claude Code 的组合:

  • 如果你只是偶尔写些脚本、小工具,现有 Claude / GPT 模型已经够用,可以不折腾;
  • 如果你经常做中大型项目、需要 Agent 式自动化工具链、或对多模态/长上下文有刚需,那么把 Claude Code 背后的「默认引擎」换成 Gemini 3 Pro 是非常值得的投入。

本文给出的配置方式完全基于官方公开接口与 TokHub 提供的 Anthropic 兼容网关,你可以安全地在本地按步骤尝试。
有了更强的推理与 Agent 能力,Claude Code 才算真正「解锁了上限」。

如果你已经在用这套组合,欢迎在评论区分享你的实际体验与踩坑记录,我们可以在后续文章里继续补充更深入的案例与最佳实践。

相关教程推荐:

  • 《Claude Code:这个AI编程助手,像给代码请了个24小时贴身管家》:整体介绍 Claude Code 的能力和付费档位,适合还在观望的同学。路径:/news/claude-code-ai-programming-assistant/
  • 《Claude 4.5 Sonnet 发布,号称全球最强编码模型》:聚焦 Anthropic 官方基准测试与 Sonnet 4.5 的编码表现。路径:/news/claude-4-5-sonnet-worlds-strongest-coding-model/