很多人已经习惯用 Claude Code 写代码了,但真正决定「体验上限」的,其实是背后接的模型。
这篇文章的目标是两件事:
- 说明:为什么我会在本地开发里优先选择 Gemini 3 Pro,而不是只用默认的 Claude / GPT;
- 实战:手把手演示如何通过 TokHub 把
gemini-3-pro-preview接到 Claude Code 里使用。
文中所有关于 Gemini 3 的性能数据,均来自 Google DeepMind 官方 Gemini 3 模型页面(https://deepmind.google/models/gemini/),并在下文中用表格形式整理,方便你快速判断「值不值得折腾」。
提示:本文偏向「实战+选型」,适合已经在用 Claude Code,想进一步把 Gemini 3 纳入日常开发工作流的同学。
一、为什么要用 Gemini 3?
1. 官方定位:当前最智能的 Gemini 模型
根据 Google DeepMind 官方介绍:
- Gemini 1:解决了「多模态 + 长上下文」;
- Gemini 2:在「推理、思考、工具调用」上进入 agent 时代;
- Gemini 3:把这些能力真正合在一起,强调「帮你学习、构建、规划任何事情」。
在产品形态上,目前主要有三条线:
- Gemini 3 Pro:适合复杂任务与高价值代码/项目;
- Gemini 2.5 Flash / Flash-Lite:偏向高吞吐、日常任务与成本敏感场景;
- 以及围绕前端体验的 Google Antigravity / AI Studio 等开发者工具。
对开发者而言,最直接的问题是:它相对 Claude / GPT 到底强在哪里?
2. 来自官方的硬核对比数据
下面这组数据来自 Google DeepMind 官方 Gemini 3 页面中公开的基准测试表,横向对比了 Gemini 3 Pro、Gemini 2.5 Pro、Claude Sonnet 4.5 和 GPT-5.1(只摘出对开发者很关键的几项):
数据来源:Google DeepMind – Gemini 3 模型介绍
链接:https://deepmind.google/models/gemini/
| 基准项目 | 场景说明 | Gemini 3 Pro | Gemini 2.5 Pro | Claude Sonnet 4.5 | GPT-5.1 |
|---|---|---|---|---|---|
| Humanity’s Last Exam | 学术推理,无工具 | 37.5% | 21.6% | 13.7% | 26.5% |
| ARC-AGI-2 | 视觉推理谜题 | 31.1% | 4.9% | 13.6% | 17.6% |
| GPQA Diamond | 高难度科学知识 | 91.9% | 86.4% | 83.4% | 88.1% |
| AIME 2025 | 高难数学,无工具 | 95.0% | 88.0% | 87.0% | 94.0% |
| MMMU-Pro | 多模态理解与推理 | 81.0% | 68.0% | 68.0% | 76.0% |
| ScreenSpot-Pro | 屏幕理解与操作 | 72.7% | 11.4% | 36.2% | 3.5% |
| Video-MMMU | 视频理解与知识获取 | 87.6% | 83.6% | 77.8% | 80.4% |
| LiveCodeBench Pro | 代码题 Elo(越高越好) | 2439 | 1775 | 1418 | 2243 |
| Terminal-Bench 2.0 | 终端 Agent 编码成功率 | 54.2% | 32.6% | 42.8% | 47.6% |
| SWE-Bench Verified | 真实项目修 Bug(单次尝试) | 76.2% | 59.6% | 77.2% | 76.3% |
| MRCR v2 (8-needle) 128k | 长上下文检索 | 77.0% | 58.0% | 47.1% | 61.6% |
| MRCR v2 1M | 100 万 Token 级上下文 | 26.3% | 16.4% | 不支持 | 不支持 |
简单解读几条对开发者特别关键的指标:
代码 & Agent 能力
LiveCodeBench Pro、Terminal-Bench 2.0、SWE-Bench Verified这几项结合起来,可以视为「写代码 + 用工具 + 跑长流程」的综合能力。- Gemini 3 Pro 在 Agent 相关基准上,通常 略高于 GPT-5.1,也明显领先于 Claude Sonnet 4.5。
多模态 + 屏幕理解
- 在
ScreenSpot-Pro上,Gemini 3 Pro 得分 72.7%,而 Gemini 2.5 Pro 只有 11.4%、GPT-5.1 只有 3.5%。这意味着它在「看一张界面图/截图,然后帮你操作」这一类任务上有明显优势。
- 在
长上下文能力
MRCR v2的 128k / 1M 上下文测试中,Gemini 3 Pro 对长文档、长代码库的整体理解与检索能力显著优于 2.5 代和其他模型——这对使用 Claude Code 做「整仓重构、跨项目重构」非常关键。
如果把这些指标翻译成一句话:
当你需要一个「既能写代码、又能看多模态输入、还能长时间当 Agent」的模型时,Gemini 3 Pro 是目前 DeepMind 官方给出的最强组合。
接下来我们就用这个模型来给 Claude Code「换引擎」。
二、整体方案:用 TokHub 把 Gemini 3 接到 Claude Code
Claude Code 原生是走 Anthropic 自家的 API,但它同时支持通过环境变量 / 配置来换成兼容的上游服务。
TokHub 做的事情,就是:
- 暴露一个 Anthropic 兼容的 API 网关(Base URL);
- 在后台帮你把请求转发到指定模型,比如
gemini-3-pro-preview; - 你在本地只需要改一下环境变量或
~/.claude/settings.json。
整体步骤可以概括为:
- 注册 TokHub,拿到 API Key;
- 设置环境变量或修改
~/.claude/settings.json; - 启动 Claude Code,使用
/model切到opus(被映射为 Gemini 3 Pro); - 在真实项目里验证体验与效果。
下面按步骤展开。
三、步骤一:注册 TokHub 账号并获取 Token
注:本节参考了 Ctok 官方「体验 Gemini 3 + Claude Code 教程」页面内容,并结合本文场景做了整理。
- 打开注册页面:
- 完成邮箱验证、登录后台后,访问 Token 控制台:
- 创建一个新的 API Key,并记录下来(后面会写入环境变量或配置文件中)。
建议:
- 专门为 Claude Code 创建一个独立的 Key,方便后续在控制台里区分使用场景与配额;
- 保存好 Key,不要提交到 Git 仓库,可以借助本地环境变量或
.env工具来管理。
四、步骤二:用环境变量启动 Claude Code(最快速)
如果你只是想先快速体验一下 Gemini 3 + Claude Code 的组合,推荐直接用环境变量启动。
在终端中执行:
export ANTHROPIC_AUTH_TOKEN="你的_tokhub_key"
export ANTHROPIC_BASE_URL="https://tokhub.ai"
export CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC="1"
# 按需配置默认模型
export ANTHROPIC_DEFAULT_HAIKU_MODEL="claude-haiku-4-5-20251001"
export ANTHROPIC_DEFAULT_SONNET_MODEL="claude-sonnet-4-5-20250929"
export ANTHROPIC_DEFAULT_OPUS_MODEL="gemini-3-pro-preview"
# 启动 Claude Code CLI
claude
说明:
ANTHROPIC_AUTH_TOKEN:填 TokHub 控制台里生成的 API Key;ANTHROPIC_BASE_URL:请求走 TokHub 网关,由它转发到 Gemini 3;CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1:关闭非必要网络请求,提升隐私与可控性;ANTHROPIC_DEFAULT_OPUS_MODEL:关键点,这里把原本的 Opus 型号替换成gemini-3-pro-preview,后面在 Claude Code 里用/model opus就等价于「切到 Gemini 3 Pro」。
启动成功后,在 Claude Code 的对话框里输入:
/model opus
Claude Code 就会切换到映射后的 Gemini 3 Pro 通道。你可以先给它一个熟悉的项目,让它做一次「从零解释 + 重构建议」,感受一下与之前模型的差别。
五、步骤三:写入 ~/.claude/settings.json(长期使用推荐)
如果你已经确定要长期使用 TokHub + Gemini 3 组合,建议把配置写入 ~/.claude/settings.json,避免每次都手动 export。
示例配置片段如下(只展示与环境变量相关部分):
{
"env": {
"ANTHROPIC_AUTH_TOKEN": "你的_tokhub_key",
"ANTHROPIC_BASE_URL": "https://tokhub.ai",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "claude-haiku-4-5-20251001",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "claude-sonnet-4-5-20250929",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "gemini-3-pro-preview"
}
}
修改完成后:
- 退出当前 Claude Code 会话;
- 重新在终端中执行
claude启动; - 再次用
/model opus切换模型,确认已走 TokHub + Gemini 3 通道。
如果想临时切回 Anthropic 官方通道,可以新开一个终端,不带上述环境变量启动,或者在 settings.json 中维护多个 profile,根据需要切换。
六、在 Claude Code 里用 Gemini 3 的几条实战建议
单纯「能跑起来」只是第一步,更关键的是:怎么用才不浪费 Gemini 3 的能力和额度。结合上面的官方数据和日常体验,可以给出几条实用建议:
1. 把 Gemini 3 Pro 用在「高价值任务」
从基准测试看,Gemini 3 Pro 在:
- 高难推理(Humanity’s Last Exam、AIME 2025);
- Agent 式长流程任务(Terminal-Bench、SWE-Bench、τ2-bench);
- 长上下文处理(MRCR v2 128k / 1M);
都有明显优势。建议优先用于:
- 大型重构(跨多个子仓 / 多语言混合项目);
- 对业务正确性要求很高的模块(例如结算、权限、风控);
- 需要持续「看文档 + 看代码 + 用工具」的长对话会话。
一些简单的「写个小脚本」「改一行配置」类任务,完全可以仍然交给更便宜的 2.5 Flash / Haiku 模型。
2. 善用多模态能力:截图 + 日志一起丢
有了 ScreenSpot-Pro、Video-MMMU 等指标背书,你可以放心地在 Claude Code 里这样用 Gemini 3:
- 直接把 终端截图、浏览器 DevTools 截图、监控图 和代码一起丢进去,让它帮你诊断;
- 把复杂的性能监控图表(Prometheus、Grafana)截图给它,让它解释瓶颈所在。
这种多模态输入在很多时候比你「描述半天环境」更高效。
3. 利用长上下文做「整仓级别的理解」
借助 MRCR v2 相关数据,可以放心让 Gemini 3 Pro:
- 扫一次整个服务仓库,让它输出高层架构图与依赖关系说明;
- 在大项目里做「从需求→设计→实现→测试」的一致性检查;
- 帮你找「同一业务逻辑在多个服务中的重复实现或不一致实现」。
实践上,可以把这个操作封装成几个复用 Prompt 模板,让 Claude Code 充当一名「资深代码审查员」。
总结:什么时候值得切到 Gemini 3?
综合 DeepMind 官方数据和实际体验,我会这样推荐使用 Gemini 3 + Claude Code 的组合:
- 如果你只是偶尔写些脚本、小工具,现有 Claude / GPT 模型已经够用,可以不折腾;
- 如果你经常做中大型项目、需要 Agent 式自动化工具链、或对多模态/长上下文有刚需,那么把 Claude Code 背后的「默认引擎」换成 Gemini 3 Pro 是非常值得的投入。
本文给出的配置方式完全基于官方公开接口与 TokHub 提供的 Anthropic 兼容网关,你可以安全地在本地按步骤尝试。
有了更强的推理与 Agent 能力,Claude Code 才算真正「解锁了上限」。
如果你已经在用这套组合,欢迎在评论区分享你的实际体验与踩坑记录,我们可以在后续文章里继续补充更深入的案例与最佳实践。
相关教程推荐:
- 《Claude Code:这个AI编程助手,像给代码请了个24小时贴身管家》:整体介绍 Claude Code 的能力和付费档位,适合还在观望的同学。路径:
/news/claude-code-ai-programming-assistant/- 《Claude 4.5 Sonnet 发布,号称全球最强编码模型》:聚焦 Anthropic 官方基准测试与 Sonnet 4.5 的编码表现。路径:
/news/claude-4-5-sonnet-worlds-strongest-coding-model/
