Faraday Inherent 推出的 AI 科学家智能体
Faraday是什么
Faraday 是伦敦 AI 实验室 Inherent 推出的 AI 科学家智能体,基于 270 亿参数的 Qwen 3.6 模型,通过强化学习训练而成。Faraday能像人类博士生一样,在不预先知道答案的情况下,自主阅读论文、设计实验并复现研究结果。Faraday 在论文复现基准 Replica 上表现超越 Claude Opus 4.8 和 GPT-5.5 。

Faraday的主要功能
· 自主论文复现 :阅读被遮盖结果图表的学术论文,推断实验方法,在 60 分钟 + 有限 GPU 资源内自主设计并执行复现实验
· 科学实验设计 :面对无法全规模复现的实验,能按比例缩小但仍忠实于原论文核心主张,展现研究品味
· 工具调用编程 :将 Codex GPT-5.5 作为外部编码工具,自己负责科学决策,代码执行交给专业编程 agent
· 跨领域泛化 :训练于 ML 论文,测试于 AI-for-Science 论文,具备跨领域迁移能力
Faraday的技术原理
· 基座模型选择 :Faraday 基于 Qwen 3.6-27B 构建,仅 270 亿参数,团队通过强化学习后训练赋予其科学决策能力,将代码实现交由外部工具完成,验证科学智能与工程智能可以解耦。
· Coding Agent as a Tool (CAT) 架构 :Faraday 通过 shell 工具调用 Codex GPT-5.5 作为外部编程助手;Faraday 专注高层科学决策,包括理解论文、设计实验方案和分配计算资源,由 Codex 负责具体的代码编写与调试执行。
· Replica 任务空间 :训练数据来自自动生成的 Replica 基准,涵盖 100 篇 1990–2026 年的知名论文共 310 个复现任务;用 Gemini 2.5 Pro 自动识别并遮盖论文中的结果图表形成任务,Agent 需在 60 分钟和 1/7 个 H200 GPU 的严格限制内自主复现本。
· Rubric-based Judge 奖励系统: 针对复现任务无确定答案的难题,系统先用 Claude Opus 4.7 为每个任务自动生成专属评分标准(隐藏原始 gold plot 以防过拟合),再由 Codex GPT-5.5 作为执行 judge,在 10 分钟内审查代码库、git 历史和交互记录,从视觉匹配、科学主张支持、实验忠实度、资源利用效率和科学诚信五个维度给出 0–1 分的奖励信号。
· 长程强化学习训练 :Faraday 采用修改版 GRPO 算法配合 LoRA 微调(rank=128),在 128K token 上下文窗口中以 6×10⁻⁶ 学习率进行后训练;每批次均匀采样覆盖不同时代的论文,确保训练不受单一科学范式主导,实现稳定的长程非可验证任务优化。
如何使用Faraday
Faraday 目前处于研究发布阶段,尚未推出面向公众的 API、产品界面或体验入口。
Faraday的核心优势
· 小模型大能力 :基于 270 亿参数的 Qwen 3.6,在论文复现任务上超越 Claude Opus 4.8 和 GPT-5.5,证明科学智能无需依赖超大规模模型。
· 工具解耦架构 :采用 Coding Agent as Tool (CAT) 范式,Faraday 专注科学决策,将代码实现交由 Codex GPT-5.5 完成,实现科学智能与工程智能的高效分工。
· 研究品味培养 :通过强化学习习得研究品味,在资源受限时仍能设计忠实于原论文的缩小版实验,拒绝硬编码和作弊捷径。
· 跨领域泛化 :在 ML 论文上训练,在 AI-for-Science 论文上测试仍保持 60% 以上任务胜率,展现强大的跨领域迁移能力。
· 可扩展基准 :基于 Replica 自动生成任务空间,从 100 篇论文扩展出 310 个复现任务,为 AI 科学家训练提供可规模化的数据基础。
· 稳定长程 RL 成功将 GRPO 强化学习扩展到长程、非可验证的科研任务,通过 per-task rubric judge 和 turn-level credit assignment 实现稳定训练。
Faraday的项目地址
· 项目官网 :https://inherentlabs.ai/research/training-to-replicate
· arXiv技术论文 :https://arxiv.org/pdf/2608.13331
Faraday的同类竞品对比
对比维度 | Faraday (Inherent) | The AI Scientist (Sakana AI)
核心定位 | 专注论文复现,验证已有研究结果的可靠性 | 端到端自主科研——从假设生成到论文撰写的全流程
基座模型 | Qwen 3.6-27B(小模型+外部工具) | 调用 Claude/GPT 等前沿模型作为基础
工作方式 | 像人类博士生一样复现论文图表,使用 Codex 作为编程工具 | 自主提出研究想法、运行实验、撰写 LaTeX 论文
任务范围 | 复现已发表论文中的特定结果图表(Replica 基准) | 从零开始生成完整研究课题并产出可投稿论文
验证方式 | 自动 Rubric-based Judge + 人类专家评估复现质量 | 通过真实学术会议(ICLR Workshop)同行评审验证
开源情况 | 论文与 Replica 基准已公开,模型未开源 | AI Scientist v1/v2 代码已在 GitHub 开源
Faraday的应用场景
· 学术论文复现验证 :科研机构可用 Faraday 批量验证已发表论文的可复现性,解决机器学习领域的复现危机。
· 博士生科研训练 :作为虚拟研究助手,帮助博士生通过复现经典论文来培养实验设计与科学品味。
· AI-for-Science 实验验证 :在材料科学、气象预测、生物信息学等领域,自动复现跨学科论文中的实验结果。
· 研究基准测试 :为 AI 科学家 Agent 提供标准化的 Replica 评估框架,用于衡量不同模型在科研任务上的能力。
· 研究方法审计 :期刊审稿人或基金评审机构可用 Faraday 快速检验投稿论文中实验结果的真实性与可复现性。