Files
obsidian-notes/InBox/_AI翻译_别再自己钻研Claude技巧了_Autoresearch帮你搞定_BV1tJwKzDE8x_笔记.md
2026-06-09 10:48:33 +08:00

8.1 KiB
Raw Permalink Blame History

AutoResearch 自动优化 Claude Code Skills 完整指南

目录


核心概念

Claude Code Skills 现状

Claude Code Skills云代码技能是用于扩展 Claude Code 能力的提示词文件,但存在稳定性问题

指标 比例
运行技能得到预期输出 ~70%
运行技能输出垃圾结果 ~30%

什么是 AutoResearch

AutoResearch 是由 Andre KarpathyOpenAI 创始成员、前特斯拉 AI 负责人)发布的一个 GitHub 仓库,核心功能是让一组 AI 智能体能够自主优化某个流程

原仓库地址:

https://github.com/karpathy/auto-research

AutoResearch 仓库解析

该仓库刻意设计得非常精简,只有三个重要文件

文件结构

auto-research/
├── prepare.py      # 机器学习专用(训练分词器等),与技能优化无关
├── train.py        # 核心文件,相当于你的 skill.md
└── program.py      # 核心文件,相当于你的智能体

工作原理类比

AutoResearch 组件 对应内容
train.py 你的 skill.md(要优化的技能提示词)
program.py 你的智能体(负责改进技能)

优化流程

1. 给智能体program.py一个高级指令
2. 智能体运行技能train.py根据评估标准评分
3. 智能体判断"这次是否比上次好"
4. 自动迭代,提示词越来越严密
5. 每 N 分钟自动运行一次(如每 5 分钟)

自动研究的三个要素

要让自动研究工作,你需要准备好:

1. 客观指标Objective Metric

一个可量化测量的数字,而不是模糊的感觉描述。

示例:

应用场景 客观指标
网站加载速度 毫秒ms
冷邮件活动 回复率(%
Claude Code Skill 通过率 / 评估分数

2. 测量工具Measurement Tool

理想情况下应该自动化、可靠,无需人工介入。

示例:

应用场景 测量工具
网站性能 Google Lighthouse
冷邮件 即时 API 分析
Skills 测试套件(智能体编写的自动化测试)

3. 可改变的东西Variable to Change

整个优化的对象:

应用场景 改变的内容
网站优化 代码改动
冷邮件优化 邮件文案
Skills 优化 提示词内容skill.md 文件)

评估设计原则

为什么需要多次运行评估

AI 输出本质上是数据分布,存在随机性:

运行 20 次技能(生成 20 张图片)
  ↓
每次输出都有细微差别
  ↓
有些图片相似,有些不同
  ↓
必须运行多次,用统计方法评估

评估的三个统计指标

指标 含义 作用
众数Mode 出现频率最高的值 判断"最常见的结果是什么"
中位数Median 排序后的中间值 判断"大致平均水平"
平均值Mean 所有分数之和除以次数 判断"总体表现"

二元问题原则(核心要点)

评估应该使用二元的是/否、真/假问题,尽量避免多值评分。

原因: 复合概率导致变异性放大

二元评分:只有 Pass/Fail → 变异性可控
多值评分(如 1-7 分)→ 每个环节的变异会累积放大
       ↓
想象一个漏斗:开始很窄,变异累积后可能差很多
最终结果可能从 39/40 变成 2/40

多值评分的风险示例:

  • 如果给模型太多评估点
  • 模型可能学会"复述每个评估点"来通过测试
  • 就像不理解材料但能考 100 分的学生

不要过于具体/狭窄

反面示例(过于严格):

"确保输出在 X 字以内"
"确保包含关系符号"
"确保不包含某些字符"

这会导致模型过度优化评估指标而不是真正提升质量。


实战演示流程

演示案例:图表生成器技能优化

步骤一:设置 Claude Code 环境

在 VSCode 或任意编辑器中安装 Claude Code 扩展,设置好开发环境。

步骤二:获取 AutoResearch 仓库

# 将仓库链接提供给智能体
"Read this: https://github.com/karpathy/auto-research"

步骤三:创建评估标准

将评估标准定义为4 个二元问题

# 评估标准 具体要求
1 文字清晰度 所有文字是否清晰且语法正确
2 配色方案 是否符合粉彩色、柔和色调(避免霓虹色)
3 布局条理 是否从左到右/从上到下有条理(无乱糟糟的气泡和装饰)
4 无数字编号 是否没有 "1, 2, 3, 4" 这样的编号

步骤四:提供高级指令给智能体

使用自然语言描述任务:

"我想让你用 AutoResearch 库来改进图表生成器技能。
  
  该技能的功能是生成约 200 字的脚本。
  
  请用上面的仓库中的自动研究方法帮我建立一套改进系统。
  
  每次测试请生成 10 个图表。
  
  我希望你按回车继续。"

步骤五:明确评分机制

生成 10 张图片
每个图片用 4 个标准评估
最高分 = 40 分10 × 4

流程:
1. 生成 10 张图
2. 用 4 个标准评估所有 10 张
3. 计算 40 分中的得分
4. 修改提示词
5. 再试一次
6. 选择表现更好的版本

演示结果

网站优化案例

指标 优化前 优化后 改进
加载时间 1100ms 67ms 81.3%

图表生成器技能案例

指标 第一次测试 后续迭代
评估分数 32/40 37/40
迭代趋势 基准 持续提升

视频效果: 智能体不断让提示词越来越符合预设的粉彩色、可爱图标等规格。


最佳实践与注意事项

推荐做法

  1. 使用二元问题评估

    • 是/否、真/假
    • 避免 1-10 分等多值评分
  2. 保持评估标准简洁

    • 每个技能 3-5 个核心标准
    • 太多标准会导致"假通过"
  3. 让评估自动化

    • 编写测试套件
    • 设置定时循环运行
  4. 记录所有变更

    • 模型尝试的所有改动清单
    • 可传承给未来的更强模型GPT-6、Claude 4.0 等)

避免做法

  1. 不要过于具体

    ✗ "确保输出在 100 字以内"
    ✗ "确保包含关系符号"
    
  2. 不要多值复合评分

    ✗ "X 方面打 1-7 分"
    ✓ "X 方面是否达标:是/否"
    
  3. 不要只运行一次

    • 必须多次运行取统计结果
    • 用众数、中位数判断质量

可应用场景扩展

AutoResearch 不仅限于 Skills 优化,可应用领域:

领域 优化目标
网站 加载速度、SEO
落地页 转化率
A/B 测试 标题、缩略图
邮件营销 邮件文案、回复率
代码 性能、架构
提示词 任何技能或流程

资源链接


总结

AutoResearch 提供了一种让 AI 自主优化 AI 的方法论。通过:

  1. 定义客观指标 → 知道要优化什么
  2. 建立测量工具 → 知道如何量化改进
  3. 提供可变量 → 提示词、代码或文案
  4. 多次运行 + 统计评估 → 确保结果可靠

即使你不是机器学习专家,也可以利用这个框架显著提升 Claude Code Skills 的可靠性和准确性,实现技能的自我进化