11
This commit is contained in:
@@ -1,7 +1,15 @@
|
||||
# AutoHarness 深度解读
|
||||
|
||||
> 来源:https://zhuanlan.zhihu.com/p/2016839356833341880
|
||||
> 收藏时间:2026-03-25
|
||||
---
|
||||
原文发布链接: https://zhuanlan.zhihu.com/p/2016839356833341880
|
||||
tags:
|
||||
- AutoHarness
|
||||
- AI
|
||||
- 论文解读
|
||||
- AutoHerness
|
||||
- LLM
|
||||
- Agent
|
||||
- ProgramSynthesis
|
||||
- GRPO强化学习
|
||||
---
|
||||
|
||||
## 一句话总结
|
||||
|
||||
@@ -1,81 +0,0 @@
|
||||
# 在实际工作流中验证了四个月并可跨 project 复用的 AGENTS.md
|
||||
|
||||
**来源**: [知乎](https://zhuanlan.zhihu.com/p/2009629370684306095)
|
||||
**收录时间**: 2026-04-09
|
||||
**标签**: #Agent #代码规范 #项目管理
|
||||
|
||||
---
|
||||
|
||||
## 文档写作原则:Self-Contained(自解释)
|
||||
|
||||
所有文档(PROGRESS.md、STATES.md、EXPERIMENTS.md、TODO.md)必须做到**只读文档就能完全理解**,不依赖对话上下文或任何脑内默认知识。
|
||||
|
||||
### 核心要求
|
||||
|
||||
1. **每个方法首次出现时必须解释它是什么、怎么做的**。不能只写"方法 A 效果好",必须写"方法 A(用因果卷积在 MLP 打分前丰富 token 特征,让 gate 感知邻居信息)效果好"
|
||||
|
||||
2. **不要假设读者知道任何缩写**。首次使用缩写时必须给出全称和一句话解释。例如不要写"STE",要写"STE(Straight-Through Estimator,前向用 hard 0/1 掩码,反向用 sigmoid 梯度近似)"
|
||||
|
||||
3. **实验结论必须包含足够上下文**。不要写"差距缩小到 0.001",要写"TopK 自适应选择与 Fixed 周期掩码的质量差距从 0.005 缩小到 0.001(提高 gate 学习率从 0.001 到 0.1)"
|
||||
|
||||
4. **数字必须有参照物**。不要写"val_bpb=0.8605",要写"val_bpb=0.8605(对比:无加速 baseline=0.840,Fixed 周期掩码=0.8605)"
|
||||
|
||||
5. **因果链要完整**。不要只记录结论,要记录**为什么**。"TopK 不如 Fixed"不够,要写"TopK 不如 Fixed,因为 TopK 的 think token 48% 紧挨着聚集(间距=1),导致部分 skip token 的信息供给不足(信息瓶颈),而 Fixed 均匀间隔保证每个 think token 只需支撑 2 个 skip token"
|
||||
|
||||
6. **docs/STATES.md 顶部维护一个术语表**,所有关键术语集中定义。其他文档开头引用该术语表即可
|
||||
|
||||
### 反面例子(禁止)
|
||||
- "V11 实验效果不错" → 什么是 V11?做了什么?效果不错是多少?
|
||||
- "提高了 gate LR" → 从多少到多少?为什么要提高?效果改善了多少?
|
||||
- "信息瓶颈是核心问题" → 什么信息?什么瓶颈?为什么是核心?
|
||||
|
||||
### 正面例子(要求)
|
||||
- "TopKConvGate 实验(在 MLP 打分前用 768 通道因果深度卷积让每个 token 看到前 7 个邻居的特征,帮助 gate 感知局部上下文以减少 think token 聚集):E4T4D4 架构下 5k 步 val_bpb=0.8610,仍略差于 Fixed 周期掩码(0.8605),差距 0.0005"
|
||||
|
||||
---
|
||||
|
||||
## 项目管理工作流
|
||||
|
||||
### 文档维护规范
|
||||
|
||||
**docs/PROGRESS.md**: 只记录"已经完成"的工作/实验/结论(附关键脚本/日志/ckpt 路径),不要写待办计划。
|
||||
|
||||
**docs/TODO.md**: 只记录"未完成/进行中/下一步"的待办与计划(尽量可一键复现);完成后从 docs/TODO.md 移除对应项,并把结果写入 docs/PROGRESS.md(避免重复记录)。
|
||||
|
||||
**docs/STATES.md**: 只维护已经完成的成果,录入真正长期有用的东西而非临时的噪音。
|
||||
|
||||
**docs/EXPERIMENTS.md**: 实验相关内容的特殊STATE,专注于处理实验和数据。
|
||||
|
||||
### 关键原则
|
||||
|
||||
- 能用小数据集/短实验快速 debug 就不要用大数据集/长实验;优先最快迭代
|
||||
- 每次准备做实验前必须先高层质疑与方向审视确认当前未知/最小实验/失败后下一步
|
||||
- 两个文档都必须按时间升序记录(越早在前、越晚在后),新增内容只能追加到文件末尾
|
||||
- 训练评测时只要是正式实验,一定要在正规文件里弄好脚本然后一键几乎无传参地跑
|
||||
- 跑训练或评测必须在 tmux 里启动,避免中途断开导致任务退出
|
||||
- 时刻注意删掉没用的 checkpoint 等大文件,维护空间不爆炸
|
||||
- 有多个相同功能文件的时候,请把错误的冗余的全部都扔进 archive,只保留一个
|
||||
|
||||
### Git 提交规范
|
||||
|
||||
当完成一个完整功能或要进行破坏性改动时:
|
||||
```bash
|
||||
git add .
|
||||
git commit -m "描述"
|
||||
```
|
||||
|
||||
- 发现任何文档或代码有错误时,更新不要保留任何错误痕迹
|
||||
- 写了一个新版本的正确文件,请删掉错误版本的文件
|
||||
- 兼容性不要搞得那么好,不要 fallback
|
||||
- 同样的功能禁止有错误实现,并且只能有一个位置正确实现,禁止冗余
|
||||
|
||||
---
|
||||
|
||||
## 其他要点
|
||||
|
||||
- 跟我沟通请使用中文。任何的临时测试都请在 tmp 文件夹
|
||||
- 我们现在是在一个Docker环境里边,使用公共服务器的电脑。千万不要跟别的程序抢占GPU,这是绝对禁令
|
||||
- 想用 GPU 的时候用 nvidia-smi 查看空闲 GPU 然后精确加载空闲的
|
||||
- 你只要遇到问题就处理,遇到问题就处理,直到没有问题。不要问我顺序什么的
|
||||
- 有不清楚的先记下来跳过,所有探究实现路径全部卡住了再都通知我
|
||||
- 没用的东西放 archive/
|
||||
@@ -1,29 +0,0 @@
|
||||
# CLIProxyAPI
|
||||
|
||||
**GitHub**: https://github.com/router-for-me/CLIProxyAPI
|
||||
**添加时间**: 2026-03-24
|
||||
**提醒时间**: 2026-03-25 10:00
|
||||
**标签**: #代理 #CLI #工具
|
||||
|
||||
---
|
||||
|
||||
## 项目简介
|
||||
|
||||
(待补充 - 明天落实时填写)
|
||||
|
||||
## 主要功能
|
||||
|
||||
(待补充)
|
||||
|
||||
## 安装使用
|
||||
|
||||
(待补充)
|
||||
|
||||
## 备注
|
||||
|
||||
- 用户要求:无风险的情况下落实
|
||||
- 提醒已设置:明天(3月25日)10:00
|
||||
|
||||
---
|
||||
|
||||
**原始链接**: https://github.com/router-for-me/CLIProxyAPI
|
||||
@@ -1,36 +0,0 @@
|
||||
# 大家有没有感觉最近大模型变笨了
|
||||
|
||||
**来源**: https://www.v2ex.com/t/1196441#reply25
|
||||
**保存时间**: 2026-03-24
|
||||
**标签**: #AI #大模型 #讨论
|
||||
|
||||
---
|
||||
|
||||
## 帖子摘要
|
||||
|
||||
楼主提问:大家有没有感觉最近大模型变笨了?
|
||||
|
||||
主要讨论点:
|
||||
- 用户感觉 GPT-4、Claude 等大模型最近回复质量下降
|
||||
- 有人认为是心理作用或期望值提高
|
||||
- 也有人提到可能是模型更新导致的风格变化
|
||||
- 讨论涉及多个主流大模型:GPT-4、Claude、Gemini 等
|
||||
|
||||
---
|
||||
|
||||
## 关键回复观点
|
||||
|
||||
1. **心理作用论**: 用多了之后对模型能力边界更清楚,所以感觉"变笨"
|
||||
2. **模型更新论**: OpenAI 等厂商确实会调整模型,可能影响某些任务的表现
|
||||
3. **任务复杂度**: 随着使用深入,提出的问题更难,模型显得力不从心
|
||||
4. **对比效应**: 新模型出来后,旧模型相对显得弱了
|
||||
|
||||
---
|
||||
|
||||
## 个人思考
|
||||
|
||||
(待补充)
|
||||
|
||||
---
|
||||
|
||||
**原始链接**: https://www.v2ex.com/t/1196441#reply25
|
||||
@@ -1,11 +0,0 @@
|
||||
---
|
||||
type: clip
|
||||
created: 2025-08-05
|
||||
source: https://mp.weixin.qq.com/s/cNWUHBjR8GJvtGKIME9ZBg
|
||||
tags:
|
||||
- 战斗
|
||||
- 状态同步
|
||||
- InBox
|
||||
---
|
||||
|
||||
- [介绍状态同步战斗玩法的设计和实现(以移动举例)](https://mp.weixin.qq.com/s/cNWUHBjR8GJvtGKIME9ZBg)
|
||||
@@ -1,20 +0,0 @@
|
||||
---
|
||||
title: 测试笔记 - 共享目录转移
|
||||
date: 2026-03-20
|
||||
tags: [测试, 共享目录]
|
||||
---
|
||||
|
||||
# 测试笔记
|
||||
|
||||
这是一篇测试笔记,用于验证共享目录转移流程。
|
||||
|
||||
## 创建信息
|
||||
- 创建时间: 2026-03-20 03:01
|
||||
- 来源: Mac mini 共享目录
|
||||
- 目标: zanepc Obsidian InBox
|
||||
|
||||
## 测试内容
|
||||
如果这篇笔记能成功转移到 zanepc 的 Obsidian 中,说明流程配置正确。
|
||||
|
||||
---
|
||||
*自动创建用于测试共享目录转移*
|
||||
Reference in New Issue
Block a user