WikiSkill 谷歌推出的 Agent 技能进化框架
WikiSkill是什么
WikiSkill 是 Google Research 推出的 Agent 技能进化框架。框架通过三层架构,存储原始轨迹的 Raw Layer、持续积累结构化知识的 Wiki Layer、以及存放可执行技能的 Skills Layer,让 Agent 经验沉淀为持久知识,再从中生长出可复用技能。每轮迭代中,Wiki Maintainer 分析轨迹更新知识库,Skill Proposer 基于知识提出技能更新,经验证后接受或回滚。实验表明,9B 模型加 WikiSkill 可超越 27B 裸模型,且技能可跨模型迁移。

WikiSkill的主要功能
三层知识分离 :将原始轨迹、结构化知识与可执行技能分三层存储,各司其职。
技能自主进化 :通过迭代循环让 Agent 技能从经验中持续生长和优化。
持久知识积累 :Wiki 层跨迭代持续沉淀,拒绝的技能不丢失已积累的知识。
跨模型迁移 :进化后的技能可在不同模型甚至不同模型家族间复用。
验证门控过滤 :候选技能经验证集评估,仅接受能提升性能的更新。
WikiSkill的技术原理
三层架构 :Raw Layer 永久存储不可变的执行轨迹,作为事实依据;Wiki Layer 将轨迹编译为结构化模式与进化日志,持续积累且永不回滚;Skills Layer 存放当前生效的可执行技能,支持条件更新与回滚,通过 PURPOSE.md 实现技能溯源。
四步进化循环 :Inference Agent 用当前技能在训练集上执行并产出轨迹;Wiki Maintainer 采样轨迹做根因分析,更新 Wiki 的模式目录与日志;Skill Proposer 用 ReAct 方式读取 Wiki 和轨迹,提出单次技能创建或补丁;Gating 机制在验证集上评估候选技能,分数提升则接受,否则回滚技能(Wiki 不受影响)。
知识持久化设计 :Wiki 层通过 skill-impact.md 记录每次提案的 diff、验证分数与接受/拒绝结果,形成客观审计轨迹,使后续 Proposer 能避免重复失败方案,实现跨迭代的知识复利。
技能发现与执行分离 :实验表明技能发现(从经验中提炼策略)和技能执行(在推理时应用策略)是两种不同能力,WikiSkill 进化的技能可跨模型迁移,甚至其他模型进化的技能优于模型自身进化的技能。
如何使用WikiSkill
初始化工作空间 :创建 raw/ 、 wiki/ 、 skills/ 三层目录,从空技能集开始。
执行训练 rollout :Inference Agent 用当前技能在训练集上运行,产出执行轨迹写入 raw/ 。
更新知识库 :Wiki Maintainer 采样成功/失败轨迹做根因分析,在 wiki/patterns/ 创建或更新模式文件,并追加 logs.md 和 skill-impact.md 。
提出技能更新 :Skill Proposer 读取 Wiki 索引、历史影响记录和原始轨迹,用 ReAct 方式提出单次技能创建或补丁。
验证与门控 :候选技能在验证集上评估,分数提升则接受为新的 skills/ 。
循环迭代 :重复上述步骤直到验证性能收敛或达到预设迭代次数,最终获得进化后的技能集用于推理。
WikiSkill的核心优势
持久知识复利 :Wiki 层跨迭代持续积累,技能被拒绝时知识不丢失,后续更新可复用全部历史洞察。
知识技能解耦 :将知道什么与怎么做分离,技能可回滚而知识永续,避免经验随技能补丁一同丢失。
小模型逆袭大模型 :Qwen-3.5-9B 加 WikiSkill 即可超越 Qwen-3.6-27B 裸模型,用知识弥补规模差距。
跨模型迁移复用 :进化技能可跨模型家族迁移,其他模型发现的策略有时优于模型自身进化的技能。
避免重复踩坑 :skill-impact.md 完整记录提案历史与拒绝原因,Proposer 不再重复已失败的方案。
WikiSkill的项目地址
arXiv技术论文 :https://arxiv.org/pdf/2608.27454
WikiSkill的同类竞品对比
对比维度 | WikiSkill (Google Research) | SkillOpt (Microsoft Research) |
|---|---|---|
核心思想 | 在经验与技能之间增加持久知识层(Wiki),知识持续积累,技能从知识中生长 | 将技能文档视为可训练的外部状态,用深度学习风格的优化器迭代更新 |
知识管理 | 三层架构分离:Raw → Wiki → Skills;Wiki 永不回滚,支持跨迭代知识复利 | 单技能文档作为训练状态,无独立持久知识层,依赖拒绝编辑缓冲区和元指导 |
进化机制 | Wiki Maintainer 做根因分析并更新结构化知识库,Skill Proposer 从知识中提出更新 | 六阶段 ReflACT 流水线:Rollout → Reflect → Aggregate → Select → Update → Evaluate |
编辑策略 | 增量补丁编辑(创建/修改技能),每次原子性提案只针对单个技能 | 结构化 add/delete/replace 编辑,引入编辑预算作为文本学习率 |
验证门控 | 验证集严格提升则接受,否则回滚技能(Wiki 不受影响) | 验证集严格提升则接受,拒绝编辑存入缓冲区作为负反馈 |
跨模型迁移 | 明确验证:技能可跨模型家族迁移,其他模型进化的技能优于自进化 |
WikiSkill的应用场景
智能办公自动化 :处理复杂 Excel 公式计算、数据清洗与跨表格关联,Agent 通过进化掌握先 recalculate 再读取等电子表格专用工作流。
长文档智能问答 :在数百页 PDF/Word 文档中执行多步检索导航,进化出的搜索技能可指导 Agent 高效定位关键段落,避免长上下文迷失。
数学推理与解题 :将竞赛级数学题的解题经验沉淀为可复用策略,持续提升解题准确率。
网络信息检索 :优化多轮搜索流程,进化出关键词扩展 → 多源交叉验证 → 信息整合的标准操作程序,提升复杂查询的召回与准确性。
交互式具身任务 :在虚拟环境中执行多步骤物理操作,通过沉淀避免重复动作循环检查任务完成状态等模式,提升任务成功率。