Gemini 3.8 谷歌推出的推理与编码模型
Gemini 3.8是什么
Gemini 3.8 是 Google 推出的推理与编码模型,包含 Flash 和 Flash Cyber 两个版本。Gemini 3.8 Flash 在保持与前代相同速度和低价的基础上,大幅提升软件工程、Agent 任务及多步推理能力,在代码、金融、法律等基准测试中接近甚至超越更大参数的前沿模型。Gemini 3.8 Flash Cyber 是专为网络安全打造的版本,具备顶尖漏洞发现与自动补丁修复能力,仅通过 Fairwind Program 向认证安全防御人员开放。

Gemini 3.8的主要功能
- 长周期软件工程 :自主完成复杂工程问题的端到端解决,在 DeepSWE 等基准中表现接近甚至超越更大参数的前沿模型。
- 自主 Agent 任务 :支持复杂多步骤的 Agent 工作流,可执行迭代式工具调用与推理,适用于终端编码、计算机操作等场景。
- 专业领域推理 :在金融分析、法律工作流及跨学科专家推理中展现出企业级可靠性。
- 网络安全攻防 :Flash Cyber 版本专注于自主漏洞发现与自动化补丁修复,在 CyberGym 和 CWE-Bench 等行业基准中达到前沿水平。
- 原生多模态 :支持文本、代码、图像、视频等多种模态输入,可生成 3D 可视化、游戏、交互式应用等富媒体内容。
Gemini 3.8的技术原理
- 长期运行的 Agent 循环机制 :Gemini 3.8 引入长期运行的 Agent 循环(long-running agentic loops),该机制使模型能在任务执行过程中递归地评估和精炼自身输出。与单次前向传播不同,模型会在复杂任务中持续迭代——执行额外的推理步骤、反复调用外部工具、根据中间结果动态调整策略,在多步骤推理和代码生成任务中实现更深度的执行和更高的准确率。
- 动态计算投入与推理强度调节 :模型采用投入更多计算量的设计哲学,在复杂任务上展现出更高的执行勤勉度(greater diligence)。模型会根据任务难度自动分配更多推理资源,在更高推理强度(higher effort levels)下可能消耗更多 Token 以最大化性能;同时,开发者可选择较低的推理强度级别来减少 Token 开销,在性能与成本之间灵活权衡。
- 网络安全领域的深度专项训练 :Gemini 3.8 Flash 和 Flash Cyber 共享同一套底层基础智能,显著的代码与推理能力提升部分源于在网络安全这一高要求领域进行的严格训练。通过在漏洞发现、补丁修复等任务上的深度优化,模型学会了识别和修复跨 20 种编程语言的复杂代码漏洞,内化防御者优先的安全思维。
如何使用Gemini 3.8
- 开发者 :通过 Google AI Studio、Gemini API 或 Android Studio 调用 3.8 Flash,也可在 Google Antigravity 中探索 Agent 优先的工作流,或在 Stitch 中生成 UI。
- 企业用户 :直接在 Gemini Enterprise 平台中接入 3.8 Flash,用于构建企业级智能应用。
- 普通消费者 :订阅 Google AI Pro 或 Ultra 后,可在 Gemini App、Google Search 的 AI Mode 以及 Google Sheets 中使用 3.8 Flash。
- 安全防御人员 :通过 Fairwind Program 提交申请,获得认证后可优先访问 3.8 Flash Cyber,用于漏洞发现与自动化补丁修复。
Gemini 3.8的核心优势
- 极致性价比 :用 Flash 系列的低价提供接近甚至超越 Claude Opus 5、GPT-5.6 等更大参数前沿模型的推理与代码能力。
- 长周期软件工程 :在 DeepSWE v1.1 等长周期软件工程基准中,能够自主端到端解决复杂工程问题,性能位居行业前列。
- 企业级专业推理 :在金融分析、法律工作流及跨学科专家推理等关键领域展现出支撑自主任务的可靠性。
- 动态计算调节 :支持根据任务复杂度灵活调整推理强度,既能在高难度任务上投入更多计算资源以最大化性能,也能在效率优先场景下降低 Token 消耗。
- 网络安全专精 :Flash Cyber 版本在漏洞发现和自动化补丁修复上达到前沿水平,且成本远低于同类大参数模型。
- 原生多模态与 Agent 能力 :基于长期运行的 Agent 循环机制,支持文本、代码、图像、视频等多模态输入,可自主迭代完成复杂多步骤任务。
Gemini 3.8的项目地址
- 项目官网 :https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Gemini 3.8的同类竞品对比
| 对比维度 | Gemini 3.8 Flash | Claude Opus 5 |
|---|---|---|
| 产品定位 | 高智能”主力模型”,兼顾性能与成本 | 旗舰级深度推理模型,追求极致智能 |
| 输入价格 | $0.75 / 百万 Token | $5.00 / 百万 Token |
| 输出价格 | $3.75 / 百万 Token | $25.00 / 百万 Token |
| DeepSWE v1.1(长周期软件工程) | 73.7% | 74.0% |
| HLE-Verified(跨学科专家推理) | 54.9% | 54.4% |
| Harvey 法律 Agent(复杂法律工作流) | 10.0% | 6.7% |
| Vals Finance Agent(金融分析) | 61.4% | 58.6% |
| 推理速度 | Flash 级别,高速响应 | 相对较慢,侧重深度 |
| 多模态能力 | 原生支持文本、代码、图像、视频 | 以文本推理为主 |
| 核心优势 | 极致性价比 + 自主 Agent 能力 | 超长上下文 + 深度逻辑推理 |
Gemini 3.8的应用场景
- 自主软件开发 :模型支持端到端完成复杂代码重构、Bug 修复与功能开发,支持长周期软件工程任务。
- 金融量化分析 :自动化解析财报与市场数据,生成投资研究报告、风险评估及合规建议。
- 法律文档审查 :快速分析合同条款、判例与法规,辅助律师完成尽职调查与合规审查。
- 网络安全防御 :自动扫描跨语言代码库漏洞并生成修复补丁,帮助安全团队快速响应威胁。
- 多模态智能应用 :基于自然语言生成 3D 交互游戏、数据可视化应用或富媒体内容。
相关工具
与本文相关的 AI 工具