Files
obsidian-notes/InBox/milky_BV1tJwKzDE8x.md

320 lines
7.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "[Milky] 为您整理《【AI翻译】别再自己钻研Claude技巧了Autoresearch帮你搞定》笔记 | BV1tJwKzDE8x"
source: "milky@4ueo.com"
date: 2026-06-09 21:17
tags: [milky, bilibili, notes]
email_id: 1983
---
Milky 为您整理了《【AI翻译】别再自己钻研Claude技巧了Autoresearch帮你搞定》| BV1tJwKzDE8x 笔记。
AutoResearch 自动优化 Claude Code Skills 完整指南
目录
核心概念
为什么需要自动研究
AutoResearch 仓库解析
自动研究的三个要素
评估设计原则
实战演示流程
演示结果
最佳实践与注意事项
核心概念
Claude Code Skills 现状
Claude Code Skills云代码技能是用于扩展 Claude Code 能力的提示词文件,但存在稳定性问题:
| 指标 | 比例 |
|------|------|
| 运行技能得到预期输出 | ~70% |
| 运行技能输出垃圾结果 | ~30% |
什么是 AutoResearch
AutoResearch 是由 Andre KarpathyOpenAI 创始成员、前特斯拉 AI 负责人)发布的一个 GitHub 仓库,核心功能是让一组 AI 智能体能够自主优化某个流程。
原仓库地址:
`
https://github.com/karpathy/auto-research
`
AutoResearch 仓库解析
该仓库刻意设计得非常精简,只有三个重要文件:
文件结构
`
auto-research/
├── prepare.py # 机器学习专用(训练分词器等),与技能优化无关
├── train.py # 核心文件,相当于你的 skill.md
└── program.py # 核心文件,相当于你的智能体
`
工作原理类比
| AutoResearch 组件 | 对应内容 |
|-------------------|----------|
| train.py | 你的 skill.md要优化的技能提示词 |
| program.py | 你的智能体(负责改进技能) |
优化流程
`
给智能体program.py一个高级指令
智能体运行技能train.py根据评估标准评分
智能体判断"这次是否比上次好"
自动迭代,提示词越来越严密
每 N 分钟自动运行一次(如每 5 分钟)
`
自动研究的三个要素
要让自动研究工作,你需要准备好:
客观指标Objective Metric
一个可量化测量的数字,而不是模糊的感觉描述。
示例:
| 应用场景 | 客观指标 |
|----------|----------|
| 网站加载速度 | 毫秒ms |
| 冷邮件活动 | 回复率(% |
| Claude Code Skill | 通过率 / 评估分数 |
测量工具Measurement Tool
理想情况下应该自动化、可靠,无需人工介入。
示例:
| 应用场景 | 测量工具 |
|----------|----------|
| 网站性能 | Google Lighthouse |
| 冷邮件 | 即时 API 分析 |
| Skills | 测试套件(智能体编写的自动化测试) |
可改变的东西Variable to Change
整个优化的对象:
| 应用场景 | 改变的内容 |
|----------|------------|
| 网站优化 | 代码改动 |
| 冷邮件优化 | 邮件文案 |
| Skills 优化 | 提示词内容skill.md 文件) |
评估设计原则
为什么需要多次运行评估
AI 输出本质上是数据分布,存在随机性:
`
运行 20 次技能(生成 20 张图片)
每次输出都有细微差别
有些图片相似,有些不同
必须运行多次,用统计方法评估
`
评估的三个统计指标
| 指标 | 含义 | 作用 |
|------|------|------|
| 众数Mode | 出现频率最高的值 | 判断"最常见的结果是什么" |
| 中位数Median | 排序后的中间值 | 判断"大致平均水平" |
| 平均值Mean | 所有分数之和除以次数 | 判断"总体表现" |
二元问题原则(核心要点)
评估应该使用二元的是/否、真/假问题,尽量避免多值评分。
原因: 复合概率导致变异性放大
`
二元评分:只有 Pass/Fail → 变异性可控
多值评分(如 1-7 分)→ 每个环节的变异会累积放大
想象一个漏斗:开始很窄,变异累积后可能差很多
最终结果可能从 39/40 变成 2/40
`
多值评分的风险示例:
如果给模型太多评估点
模型可能学会"复述每个评估点"来通过测试
就像不理解材料但能考 100 分的学生
不要过于具体/狭窄
反面示例(过于严格):
`
"确保输出在 X 字以内"
"确保包含关系符号"
"确保不包含某些字符"
`
这会导致模型过度优化评估指标而不是真正提升质量。
实战演示流程
演示案例:图表生成器技能优化
步骤一:设置 Claude Code 环境
在 VSCode 或任意编辑器中安装 Claude Code 扩展,设置好开发环境。
步骤二:获取 AutoResearch 仓库
`bash
将仓库链接提供给智能体
"Read this: https://github.com/karpathy/auto-research"
`
步骤三:创建评估标准
将评估标准定义为4 个二元问题:
| # | 评估标准 | 具体要求 |
|---|----------|----------|
| 1 | 文字清晰度 | 所有文字是否清晰且语法正确 |
| 2 | 配色方案 | 是否符合粉彩色、柔和色调(避免霓虹色) |
| 3 | 布局条理 | 是否从左到右/从上到下有条理(无乱糟糟的气泡和装饰) |
| 4 | 无数字编号 | 是否没有 "1, 2, 3, 4" 这样的编号 |
步骤四:提供高级指令给智能体
使用自然语言描述任务:
`
"我想让你用 AutoResearch 库来改进图表生成器技能。
该技能的功能是生成约 200 字的脚本。
请用上面的仓库中的自动研究方法帮我建立一套改进系统。
每次测试请生成 10 个图表。
我希望你按回车继续。"
`
步骤五:明确评分机制
`
生成 10 张图片
每个图片用 4 个标准评估
最高分 = 40 分10 × 4
流程:
生成 10 张图
用 4 个标准评估所有 10 张
计算 40 分中的得分
修改提示词
再试一次
选择表现更好的版本
`
演示结果
网站优化案例
| 指标 | 优化前 | 优化后 | 改进 |
|------|--------|--------|------|
| 加载时间 | 1100ms | 67ms | 81.3% |
图表生成器技能案例
| 指标 | 第一次测试 | 后续迭代 |
|------|------------|----------|
| 评估分数 | 32/40 | 37/40 |
| 迭代趋势 | 基准 | 持续提升 |
视频效果: 智能体不断让提示词越来越符合预设的粉彩色、可爱图标等规格。
最佳实践与注意事项
✅ 推荐做法
使用二元问题评估
- 是/否、真/假
- 避免 1-10 分等多值评分
保持评估标准简洁
- 每个技能 3-5 个核心标准
- 太多标准会导致"假通过"
让评估自动化
- 编写测试套件
- 设置定时循环运行
记录所有变更
- 模型尝试的所有改动清单
- 可传承给未来的更强模型GPT-6、Claude 4.0 等)
❌ 避免做法
不要过于具体
`
✗ "确保输出在 100 字以内"
✗ "确保包含关系符号"
`
不要多值复合评分
`
✗ "X 方面打 1-7 分"
✓ "X 方面是否达标:是/否"
`
不要只运行一次
- 必须多次运行取统计结果
- 用众数、中位数判断质量
可应用场景扩展
AutoResearch 不仅限于 Skills 优化,可应用领域:
| 领域 | 优化目标 |
|------|----------|
| 网站 | 加载速度、SEO |
| 落地页 | 转化率 |
| A/B 测试 | 标题、缩略图 |
| 邮件营销 | 邮件文案、回复率 |
| 代码 | 性能、架构 |
| 提示词 | 任何技能或流程 |
资源链接
原视频: https://www.youtube.com/watch?v=qKU-e0x2EmE
AutoResearch 仓库: https://github.com/karpathy/auto-research
完整 Claude Code 课程: 见 UP 主频道
总结
AutoResearch 提供了一种让 AI 自主优化 AI 的方法论。通过:
定义客观指标 → 知道要优化什么
建立测量工具 → 知道如何量化改进
提供可变量 → 提示词、代码或文案
多次运行 + 统计评估 → 确保结果可靠
即使你不是机器学习专家,也可以利用这个框架显著提升 Claude Code Skills 的可靠性和准确性,实现技能的自我进化。
──────────────────────────────
— Milky 视频总结助手