--- title: "[Milky] 为您整理《【AI翻译】别再自己钻研Claude技巧了,Autoresearch帮你搞定》笔记 | BV1tJwKzDE8x" source: "milky@4ueo.com" date: 2026-06-09 21:17 tags: [milky, bilibili, notes] email_id: 1983 --- Milky 为您整理了《【AI翻译】别再自己钻研Claude技巧了,Autoresearch帮你搞定》| BV1tJwKzDE8x 笔记。 AutoResearch 自动优化 Claude Code Skills 完整指南 目录 核心概念 为什么需要自动研究 AutoResearch 仓库解析 自动研究的三个要素 评估设计原则 实战演示流程 演示结果 最佳实践与注意事项 核心概念 Claude Code Skills 现状 Claude Code Skills(云代码技能)是用于扩展 Claude Code 能力的提示词文件,但存在稳定性问题: | 指标 | 比例 | |------|------| | 运行技能得到预期输出 | ~70% | | 运行技能输出垃圾结果 | ~30% | 什么是 AutoResearch AutoResearch 是由 Andre Karpathy(OpenAI 创始成员、前特斯拉 AI 负责人)发布的一个 GitHub 仓库,核心功能是让一组 AI 智能体能够自主优化某个流程。 原仓库地址: ` https://github.com/karpathy/auto-research ` AutoResearch 仓库解析 该仓库刻意设计得非常精简,只有三个重要文件: 文件结构 ` auto-research/ ├── prepare.py # 机器学习专用(训练分词器等),与技能优化无关 ├── train.py # 核心文件,相当于你的 skill.md └── program.py # 核心文件,相当于你的智能体 ` 工作原理类比 | AutoResearch 组件 | 对应内容 | |-------------------|----------| | train.py | 你的 skill.md(要优化的技能提示词) | | program.py | 你的智能体(负责改进技能) | 优化流程 ` 给智能体(program.py)一个高级指令 智能体运行技能(train.py),根据评估标准评分 智能体判断"这次是否比上次好" 自动迭代,提示词越来越严密 每 N 分钟自动运行一次(如每 5 分钟) ` 自动研究的三个要素 要让自动研究工作,你需要准备好: 客观指标(Objective Metric) 一个可量化测量的数字,而不是模糊的感觉描述。 示例: | 应用场景 | 客观指标 | |----------|----------| | 网站加载速度 | 毫秒(ms) | | 冷邮件活动 | 回复率(%) | | Claude Code Skill | 通过率 / 评估分数 | 测量工具(Measurement Tool) 理想情况下应该自动化、可靠,无需人工介入。 示例: | 应用场景 | 测量工具 | |----------|----------| | 网站性能 | Google Lighthouse | | 冷邮件 | 即时 API 分析 | | Skills | 测试套件(智能体编写的自动化测试) | 可改变的东西(Variable to Change) 整个优化的对象: | 应用场景 | 改变的内容 | |----------|------------| | 网站优化 | 代码改动 | | 冷邮件优化 | 邮件文案 | | Skills 优化 | 提示词内容(skill.md 文件) | 评估设计原则 为什么需要多次运行评估 AI 输出本质上是数据分布,存在随机性: ` 运行 20 次技能(生成 20 张图片) ↓ 每次输出都有细微差别 ↓ 有些图片相似,有些不同 ↓ 必须运行多次,用统计方法评估 ` 评估的三个统计指标 | 指标 | 含义 | 作用 | |------|------|------| | 众数(Mode) | 出现频率最高的值 | 判断"最常见的结果是什么" | | 中位数(Median) | 排序后的中间值 | 判断"大致平均水平" | | 平均值(Mean) | 所有分数之和除以次数 | 判断"总体表现" | 二元问题原则(核心要点) 评估应该使用二元的是/否、真/假问题,尽量避免多值评分。 原因: 复合概率导致变异性放大 ` 二元评分:只有 Pass/Fail → 变异性可控 多值评分(如 1-7 分)→ 每个环节的变异会累积放大 ↓ 想象一个漏斗:开始很窄,变异累积后可能差很多 最终结果可能从 39/40 变成 2/40 ` 多值评分的风险示例: 如果给模型太多评估点 模型可能学会"复述每个评估点"来通过测试 就像不理解材料但能考 100 分的学生 不要过于具体/狭窄 反面示例(过于严格): ` "确保输出在 X 字以内" "确保包含关系符号" "确保不包含某些字符" ` 这会导致模型过度优化评估指标而不是真正提升质量。 实战演示流程 演示案例:图表生成器技能优化 步骤一:设置 Claude Code 环境 在 VSCode 或任意编辑器中安装 Claude Code 扩展,设置好开发环境。 步骤二:获取 AutoResearch 仓库 `bash 将仓库链接提供给智能体 "Read this: https://github.com/karpathy/auto-research" ` 步骤三:创建评估标准 将评估标准定义为4 个二元问题: | # | 评估标准 | 具体要求 | |---|----------|----------| | 1 | 文字清晰度 | 所有文字是否清晰且语法正确 | | 2 | 配色方案 | 是否符合粉彩色、柔和色调(避免霓虹色) | | 3 | 布局条理 | 是否从左到右/从上到下有条理(无乱糟糟的气泡和装饰) | | 4 | 无数字编号 | 是否没有 "1, 2, 3, 4" 这样的编号 | 步骤四:提供高级指令给智能体 使用自然语言描述任务: ` "我想让你用 AutoResearch 库来改进图表生成器技能。 该技能的功能是生成约 200 字的脚本。 请用上面的仓库中的自动研究方法帮我建立一套改进系统。 每次测试请生成 10 个图表。 我希望你按回车继续。" ` 步骤五:明确评分机制 ` 生成 10 张图片 每个图片用 4 个标准评估 最高分 = 40 分(10 × 4) 流程: 生成 10 张图 用 4 个标准评估所有 10 张 计算 40 分中的得分 修改提示词 再试一次 选择表现更好的版本 ` 演示结果 网站优化案例 | 指标 | 优化前 | 优化后 | 改进 | |------|--------|--------|------| | 加载时间 | 1100ms | 67ms | 81.3% | 图表生成器技能案例 | 指标 | 第一次测试 | 后续迭代 | |------|------------|----------| | 评估分数 | 32/40 | 37/40 | | 迭代趋势 | 基准 | 持续提升 | 视频效果: 智能体不断让提示词越来越符合预设的粉彩色、可爱图标等规格。 最佳实践与注意事项 ✅ 推荐做法 使用二元问题评估 - 是/否、真/假 - 避免 1-10 分等多值评分 保持评估标准简洁 - 每个技能 3-5 个核心标准 - 太多标准会导致"假通过" 让评估自动化 - 编写测试套件 - 设置定时循环运行 记录所有变更 - 模型尝试的所有改动清单 - 可传承给未来的更强模型(GPT-6、Claude 4.0 等) ❌ 避免做法 不要过于具体 ` ✗ "确保输出在 100 字以内" ✗ "确保包含关系符号" ` 不要多值复合评分 ` ✗ "X 方面打 1-7 分" ✓ "X 方面是否达标:是/否" ` 不要只运行一次 - 必须多次运行取统计结果 - 用众数、中位数判断质量 可应用场景扩展 AutoResearch 不仅限于 Skills 优化,可应用领域: | 领域 | 优化目标 | |------|----------| | 网站 | 加载速度、SEO | | 落地页 | 转化率 | | A/B 测试 | 标题、缩略图 | | 邮件营销 | 邮件文案、回复率 | | 代码 | 性能、架构 | | 提示词 | 任何技能或流程 | 资源链接 原视频: https://www.youtube.com/watch?v=qKU-e0x2EmE AutoResearch 仓库: https://github.com/karpathy/auto-research 完整 Claude Code 课程: 见 UP 主频道 总结 AutoResearch 提供了一种让 AI 自主优化 AI 的方法论。通过: 定义客观指标 → 知道要优化什么 建立测量工具 → 知道如何量化改进 提供可变量 → 提示词、代码或文案 多次运行 + 统计评估 → 确保结果可靠 即使你不是机器学习专家,也可以利用这个框架显著提升 Claude Code Skills 的可靠性和准确性,实现技能的自我进化。 ────────────────────────────── — Milky 视频总结助手