Add Milky notes: 20 file(s)
This commit is contained in:
317
InBox/_AI翻译_别再自己钻研Claude技巧了_Autoresearch帮你搞定_BV1tJwKzDE8x_笔记.md
Normal file
317
InBox/_AI翻译_别再自己钻研Claude技巧了_Autoresearch帮你搞定_BV1tJwKzDE8x_笔记.md
Normal file
@@ -0,0 +1,317 @@
|
||||
# AutoResearch 自动优化 Claude Code Skills 完整指南
|
||||
|
||||
## 目录
|
||||
|
||||
- [核心概念](#核心概念)
|
||||
- [为什么需要自动研究](#为什么需要自动研究)
|
||||
- [AutoResearch 仓库解析](#autoresearch-仓库解析)
|
||||
- [自动研究的三个要素](#自动研究的三个要素)
|
||||
- [评估设计原则](#评估设计原则)
|
||||
- [实战演示流程](#实战演示流程)
|
||||
- [演示结果](#演示结果)
|
||||
- [最佳实践与注意事项](#最佳实践与注意事项)
|
||||
|
||||
---
|
||||
|
||||
## 核心概念
|
||||
|
||||
### Claude Code Skills 现状
|
||||
|
||||
Claude Code Skills(云代码技能)是用于扩展 Claude Code 能力的提示词文件,但存在**稳定性问题**:
|
||||
|
||||
| 指标 | 比例 |
|
||||
|------|------|
|
||||
| 运行技能得到预期输出 | ~70% |
|
||||
| 运行技能输出垃圾结果 | ~30% |
|
||||
|
||||
### 什么是 AutoResearch
|
||||
|
||||
AutoResearch 是由 **Andre Karpathy**(OpenAI 创始成员、前特斯拉 AI 负责人)发布的一个 GitHub 仓库,核心功能是让**一组 AI 智能体能够自主优化某个流程**。
|
||||
|
||||
原仓库地址:
|
||||
```
|
||||
https://github.com/karpathy/auto-research
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## AutoResearch 仓库解析
|
||||
|
||||
该仓库刻意设计得非常精简,**只有三个重要文件**:
|
||||
|
||||
### 文件结构
|
||||
|
||||
```
|
||||
auto-research/
|
||||
├── prepare.py # 机器学习专用(训练分词器等),与技能优化无关
|
||||
├── train.py # 核心文件,相当于你的 skill.md
|
||||
└── program.py # 核心文件,相当于你的智能体
|
||||
```
|
||||
|
||||
### 工作原理类比
|
||||
|
||||
| AutoResearch 组件 | 对应内容 |
|
||||
|-------------------|----------|
|
||||
| `train.py` | 你的 `skill.md`(要优化的技能提示词) |
|
||||
| `program.py` | 你的**智能体**(负责改进技能) |
|
||||
|
||||
### 优化流程
|
||||
|
||||
```
|
||||
1. 给智能体(program.py)一个高级指令
|
||||
2. 智能体运行技能(train.py),根据评估标准评分
|
||||
3. 智能体判断"这次是否比上次好"
|
||||
4. 自动迭代,提示词越来越严密
|
||||
5. 每 N 分钟自动运行一次(如每 5 分钟)
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 自动研究的三个要素
|
||||
|
||||
要让自动研究工作,你需要准备好:
|
||||
|
||||
### 1. 客观指标(Objective Metric)
|
||||
|
||||
一个**可量化测量**的数字,而不是模糊的感觉描述。
|
||||
|
||||
**示例:**
|
||||
|
||||
| 应用场景 | 客观指标 |
|
||||
|----------|----------|
|
||||
| 网站加载速度 | 毫秒(ms) |
|
||||
| 冷邮件活动 | 回复率(%) |
|
||||
| Claude Code Skill | 通过率 / 评估分数 |
|
||||
|
||||
### 2. 测量工具(Measurement Tool)
|
||||
|
||||
理想情况下应该**自动化、可靠**,无需人工介入。
|
||||
|
||||
**示例:**
|
||||
|
||||
| 应用场景 | 测量工具 |
|
||||
|----------|----------|
|
||||
| 网站性能 | Google Lighthouse |
|
||||
| 冷邮件 | 即时 API 分析 |
|
||||
| Skills | **测试套件**(智能体编写的自动化测试) |
|
||||
|
||||
### 3. 可改变的东西(Variable to Change)
|
||||
|
||||
整个优化的对象:
|
||||
|
||||
| 应用场景 | 改变的内容 |
|
||||
|----------|------------|
|
||||
| 网站优化 | 代码改动 |
|
||||
| 冷邮件优化 | 邮件文案 |
|
||||
| Skills 优化 | **提示词内容(skill.md 文件)** |
|
||||
|
||||
---
|
||||
|
||||
## 评估设计原则
|
||||
|
||||
### 为什么需要多次运行评估
|
||||
|
||||
AI 输出本质上是**数据分布**,存在随机性:
|
||||
|
||||
```
|
||||
运行 20 次技能(生成 20 张图片)
|
||||
↓
|
||||
每次输出都有细微差别
|
||||
↓
|
||||
有些图片相似,有些不同
|
||||
↓
|
||||
必须运行多次,用统计方法评估
|
||||
```
|
||||
|
||||
### 评估的三个统计指标
|
||||
|
||||
| 指标 | 含义 | 作用 |
|
||||
|------|------|------|
|
||||
| **众数(Mode)** | 出现频率最高的值 | 判断"最常见的结果是什么" |
|
||||
| **中位数(Median)** | 排序后的中间值 | 判断"大致平均水平" |
|
||||
| **平均值(Mean)** | 所有分数之和除以次数 | 判断"总体表现" |
|
||||
|
||||
### 二元问题原则(核心要点)
|
||||
|
||||
> **评估应该使用二元的是/否、真/假问题,尽量避免多值评分。**
|
||||
|
||||
**原因:** 复合概率导致变异性放大
|
||||
|
||||
```
|
||||
二元评分:只有 Pass/Fail → 变异性可控
|
||||
多值评分(如 1-7 分)→ 每个环节的变异会累积放大
|
||||
↓
|
||||
想象一个漏斗:开始很窄,变异累积后可能差很多
|
||||
最终结果可能从 39/40 变成 2/40
|
||||
```
|
||||
|
||||
**多值评分的风险示例:**
|
||||
- 如果给模型太多评估点
|
||||
- 模型可能学会"复述每个评估点"来通过测试
|
||||
- 就像不理解材料但能考 100 分的学生
|
||||
|
||||
### 不要过于具体/狭窄
|
||||
|
||||
**反面示例(过于严格):**
|
||||
```
|
||||
"确保输出在 X 字以内"
|
||||
"确保包含关系符号"
|
||||
"确保不包含某些字符"
|
||||
```
|
||||
|
||||
这会导致模型**过度优化评估指标**而不是真正提升质量。
|
||||
|
||||
---
|
||||
|
||||
## 实战演示流程
|
||||
|
||||
### 演示案例:图表生成器技能优化
|
||||
|
||||
#### 步骤一:设置 Claude Code 环境
|
||||
|
||||
在 VSCode 或任意编辑器中安装 Claude Code 扩展,设置好开发环境。
|
||||
|
||||
#### 步骤二:获取 AutoResearch 仓库
|
||||
|
||||
```bash
|
||||
# 将仓库链接提供给智能体
|
||||
"Read this: https://github.com/karpathy/auto-research"
|
||||
```
|
||||
|
||||
#### 步骤三:创建评估标准
|
||||
|
||||
将评估标准定义为**4 个二元问题**:
|
||||
|
||||
| # | 评估标准 | 具体要求 |
|
||||
|---|----------|----------|
|
||||
| 1 | 文字清晰度 | 所有文字是否清晰且语法正确 |
|
||||
| 2 | 配色方案 | 是否符合粉彩色、柔和色调(避免霓虹色) |
|
||||
| 3 | 布局条理 | 是否从左到右/从上到下有条理(无乱糟糟的气泡和装饰) |
|
||||
| 4 | 无数字编号 | 是否没有 "1, 2, 3, 4" 这样的编号 |
|
||||
|
||||
#### 步骤四:提供高级指令给智能体
|
||||
|
||||
使用自然语言描述任务:
|
||||
|
||||
```
|
||||
"我想让你用 AutoResearch 库来改进图表生成器技能。
|
||||
|
||||
该技能的功能是生成约 200 字的脚本。
|
||||
|
||||
请用上面的仓库中的自动研究方法帮我建立一套改进系统。
|
||||
|
||||
每次测试请生成 10 个图表。
|
||||
|
||||
我希望你按回车继续。"
|
||||
```
|
||||
|
||||
#### 步骤五:明确评分机制
|
||||
|
||||
```
|
||||
生成 10 张图片
|
||||
每个图片用 4 个标准评估
|
||||
最高分 = 40 分(10 × 4)
|
||||
|
||||
流程:
|
||||
1. 生成 10 张图
|
||||
2. 用 4 个标准评估所有 10 张
|
||||
3. 计算 40 分中的得分
|
||||
4. 修改提示词
|
||||
5. 再试一次
|
||||
6. 选择表现更好的版本
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 演示结果
|
||||
|
||||
### 网站优化案例
|
||||
|
||||
| 指标 | 优化前 | 优化后 | 改进 |
|
||||
|------|--------|--------|------|
|
||||
| 加载时间 | 1100ms | 67ms | **81.3%** |
|
||||
|
||||
### 图表生成器技能案例
|
||||
|
||||
| 指标 | 第一次测试 | 后续迭代 |
|
||||
|------|------------|----------|
|
||||
| 评估分数 | 32/40 | 37/40 |
|
||||
| 迭代趋势 | 基准 | 持续提升 |
|
||||
|
||||
**视频效果:** 智能体不断让提示词越来越符合预设的粉彩色、可爱图标等规格。
|
||||
|
||||
---
|
||||
|
||||
## 最佳实践与注意事项
|
||||
|
||||
### ✅ 推荐做法
|
||||
|
||||
1. **使用二元问题评估**
|
||||
- 是/否、真/假
|
||||
- 避免 1-10 分等多值评分
|
||||
|
||||
2. **保持评估标准简洁**
|
||||
- 每个技能 3-5 个核心标准
|
||||
- 太多标准会导致"假通过"
|
||||
|
||||
3. **让评估自动化**
|
||||
- 编写测试套件
|
||||
- 设置定时循环运行
|
||||
|
||||
4. **记录所有变更**
|
||||
- 模型尝试的所有改动清单
|
||||
- 可传承给未来的更强模型(GPT-6、Claude 4.0 等)
|
||||
|
||||
### ❌ 避免做法
|
||||
|
||||
1. **不要过于具体**
|
||||
```
|
||||
✗ "确保输出在 100 字以内"
|
||||
✗ "确保包含关系符号"
|
||||
```
|
||||
|
||||
2. **不要多值复合评分**
|
||||
```
|
||||
✗ "X 方面打 1-7 分"
|
||||
✓ "X 方面是否达标:是/否"
|
||||
```
|
||||
|
||||
3. **不要只运行一次**
|
||||
- 必须多次运行取统计结果
|
||||
- 用众数、中位数判断质量
|
||||
|
||||
---
|
||||
|
||||
## 可应用场景扩展
|
||||
|
||||
AutoResearch 不仅限于 Skills 优化,可应用领域:
|
||||
|
||||
| 领域 | 优化目标 |
|
||||
|------|----------|
|
||||
| 网站 | 加载速度、SEO |
|
||||
| 落地页 | 转化率 |
|
||||
| A/B 测试 | 标题、缩略图 |
|
||||
| 邮件营销 | 邮件文案、回复率 |
|
||||
| 代码 | 性能、架构 |
|
||||
| 提示词 | 任何技能或流程 |
|
||||
|
||||
---
|
||||
|
||||
## 资源链接
|
||||
|
||||
- **原视频:** https://www.youtube.com/watch?v=qKU-e0x2EmE
|
||||
- **AutoResearch 仓库:** https://github.com/karpathy/auto-research
|
||||
- **完整 Claude Code 课程:** 见 UP 主频道
|
||||
|
||||
---
|
||||
|
||||
## 总结
|
||||
|
||||
AutoResearch 提供了一种**让 AI 自主优化 AI** 的方法论。通过:
|
||||
|
||||
1. **定义客观指标** → 知道要优化什么
|
||||
2. **建立测量工具** → 知道如何量化改进
|
||||
3. **提供可变量** → 提示词、代码或文案
|
||||
4. **多次运行 + 统计评估** → 确保结果可靠
|
||||
|
||||
即使你不是机器学习专家,也可以利用这个框架显著提升 Claude Code Skills 的可靠性和准确性,实现技能的**自我进化**。
|
||||
Reference in New Issue
Block a user