11
This commit is contained in:
@@ -1,7 +1,15 @@
|
|||||||
# AutoHarness 深度解读
|
---
|
||||||
|
原文发布链接: https://zhuanlan.zhihu.com/p/2016839356833341880
|
||||||
> 来源:https://zhuanlan.zhihu.com/p/2016839356833341880
|
tags:
|
||||||
> 收藏时间:2026-03-25
|
- AutoHarness
|
||||||
|
- AI
|
||||||
|
- 论文解读
|
||||||
|
- AutoHerness
|
||||||
|
- LLM
|
||||||
|
- Agent
|
||||||
|
- ProgramSynthesis
|
||||||
|
- GRPO强化学习
|
||||||
|
---
|
||||||
|
|
||||||
## 一句话总结
|
## 一句话总结
|
||||||
|
|
||||||
@@ -1,81 +0,0 @@
|
|||||||
# 在实际工作流中验证了四个月并可跨 project 复用的 AGENTS.md
|
|
||||||
|
|
||||||
**来源**: [知乎](https://zhuanlan.zhihu.com/p/2009629370684306095)
|
|
||||||
**收录时间**: 2026-04-09
|
|
||||||
**标签**: #Agent #代码规范 #项目管理
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 文档写作原则:Self-Contained(自解释)
|
|
||||||
|
|
||||||
所有文档(PROGRESS.md、STATES.md、EXPERIMENTS.md、TODO.md)必须做到**只读文档就能完全理解**,不依赖对话上下文或任何脑内默认知识。
|
|
||||||
|
|
||||||
### 核心要求
|
|
||||||
|
|
||||||
1. **每个方法首次出现时必须解释它是什么、怎么做的**。不能只写"方法 A 效果好",必须写"方法 A(用因果卷积在 MLP 打分前丰富 token 特征,让 gate 感知邻居信息)效果好"
|
|
||||||
|
|
||||||
2. **不要假设读者知道任何缩写**。首次使用缩写时必须给出全称和一句话解释。例如不要写"STE",要写"STE(Straight-Through Estimator,前向用 hard 0/1 掩码,反向用 sigmoid 梯度近似)"
|
|
||||||
|
|
||||||
3. **实验结论必须包含足够上下文**。不要写"差距缩小到 0.001",要写"TopK 自适应选择与 Fixed 周期掩码的质量差距从 0.005 缩小到 0.001(提高 gate 学习率从 0.001 到 0.1)"
|
|
||||||
|
|
||||||
4. **数字必须有参照物**。不要写"val_bpb=0.8605",要写"val_bpb=0.8605(对比:无加速 baseline=0.840,Fixed 周期掩码=0.8605)"
|
|
||||||
|
|
||||||
5. **因果链要完整**。不要只记录结论,要记录**为什么**。"TopK 不如 Fixed"不够,要写"TopK 不如 Fixed,因为 TopK 的 think token 48% 紧挨着聚集(间距=1),导致部分 skip token 的信息供给不足(信息瓶颈),而 Fixed 均匀间隔保证每个 think token 只需支撑 2 个 skip token"
|
|
||||||
|
|
||||||
6. **docs/STATES.md 顶部维护一个术语表**,所有关键术语集中定义。其他文档开头引用该术语表即可
|
|
||||||
|
|
||||||
### 反面例子(禁止)
|
|
||||||
- "V11 实验效果不错" → 什么是 V11?做了什么?效果不错是多少?
|
|
||||||
- "提高了 gate LR" → 从多少到多少?为什么要提高?效果改善了多少?
|
|
||||||
- "信息瓶颈是核心问题" → 什么信息?什么瓶颈?为什么是核心?
|
|
||||||
|
|
||||||
### 正面例子(要求)
|
|
||||||
- "TopKConvGate 实验(在 MLP 打分前用 768 通道因果深度卷积让每个 token 看到前 7 个邻居的特征,帮助 gate 感知局部上下文以减少 think token 聚集):E4T4D4 架构下 5k 步 val_bpb=0.8610,仍略差于 Fixed 周期掩码(0.8605),差距 0.0005"
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 项目管理工作流
|
|
||||||
|
|
||||||
### 文档维护规范
|
|
||||||
|
|
||||||
**docs/PROGRESS.md**: 只记录"已经完成"的工作/实验/结论(附关键脚本/日志/ckpt 路径),不要写待办计划。
|
|
||||||
|
|
||||||
**docs/TODO.md**: 只记录"未完成/进行中/下一步"的待办与计划(尽量可一键复现);完成后从 docs/TODO.md 移除对应项,并把结果写入 docs/PROGRESS.md(避免重复记录)。
|
|
||||||
|
|
||||||
**docs/STATES.md**: 只维护已经完成的成果,录入真正长期有用的东西而非临时的噪音。
|
|
||||||
|
|
||||||
**docs/EXPERIMENTS.md**: 实验相关内容的特殊STATE,专注于处理实验和数据。
|
|
||||||
|
|
||||||
### 关键原则
|
|
||||||
|
|
||||||
- 能用小数据集/短实验快速 debug 就不要用大数据集/长实验;优先最快迭代
|
|
||||||
- 每次准备做实验前必须先高层质疑与方向审视确认当前未知/最小实验/失败后下一步
|
|
||||||
- 两个文档都必须按时间升序记录(越早在前、越晚在后),新增内容只能追加到文件末尾
|
|
||||||
- 训练评测时只要是正式实验,一定要在正规文件里弄好脚本然后一键几乎无传参地跑
|
|
||||||
- 跑训练或评测必须在 tmux 里启动,避免中途断开导致任务退出
|
|
||||||
- 时刻注意删掉没用的 checkpoint 等大文件,维护空间不爆炸
|
|
||||||
- 有多个相同功能文件的时候,请把错误的冗余的全部都扔进 archive,只保留一个
|
|
||||||
|
|
||||||
### Git 提交规范
|
|
||||||
|
|
||||||
当完成一个完整功能或要进行破坏性改动时:
|
|
||||||
```bash
|
|
||||||
git add .
|
|
||||||
git commit -m "描述"
|
|
||||||
```
|
|
||||||
|
|
||||||
- 发现任何文档或代码有错误时,更新不要保留任何错误痕迹
|
|
||||||
- 写了一个新版本的正确文件,请删掉错误版本的文件
|
|
||||||
- 兼容性不要搞得那么好,不要 fallback
|
|
||||||
- 同样的功能禁止有错误实现,并且只能有一个位置正确实现,禁止冗余
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 其他要点
|
|
||||||
|
|
||||||
- 跟我沟通请使用中文。任何的临时测试都请在 tmp 文件夹
|
|
||||||
- 我们现在是在一个Docker环境里边,使用公共服务器的电脑。千万不要跟别的程序抢占GPU,这是绝对禁令
|
|
||||||
- 想用 GPU 的时候用 nvidia-smi 查看空闲 GPU 然后精确加载空闲的
|
|
||||||
- 你只要遇到问题就处理,遇到问题就处理,直到没有问题。不要问我顺序什么的
|
|
||||||
- 有不清楚的先记下来跳过,所有探究实现路径全部卡住了再都通知我
|
|
||||||
- 没用的东西放 archive/
|
|
||||||
@@ -1,29 +0,0 @@
|
|||||||
# CLIProxyAPI
|
|
||||||
|
|
||||||
**GitHub**: https://github.com/router-for-me/CLIProxyAPI
|
|
||||||
**添加时间**: 2026-03-24
|
|
||||||
**提醒时间**: 2026-03-25 10:00
|
|
||||||
**标签**: #代理 #CLI #工具
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 项目简介
|
|
||||||
|
|
||||||
(待补充 - 明天落实时填写)
|
|
||||||
|
|
||||||
## 主要功能
|
|
||||||
|
|
||||||
(待补充)
|
|
||||||
|
|
||||||
## 安装使用
|
|
||||||
|
|
||||||
(待补充)
|
|
||||||
|
|
||||||
## 备注
|
|
||||||
|
|
||||||
- 用户要求:无风险的情况下落实
|
|
||||||
- 提醒已设置:明天(3月25日)10:00
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
**原始链接**: https://github.com/router-for-me/CLIProxyAPI
|
|
||||||
@@ -1,36 +0,0 @@
|
|||||||
# 大家有没有感觉最近大模型变笨了
|
|
||||||
|
|
||||||
**来源**: https://www.v2ex.com/t/1196441#reply25
|
|
||||||
**保存时间**: 2026-03-24
|
|
||||||
**标签**: #AI #大模型 #讨论
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 帖子摘要
|
|
||||||
|
|
||||||
楼主提问:大家有没有感觉最近大模型变笨了?
|
|
||||||
|
|
||||||
主要讨论点:
|
|
||||||
- 用户感觉 GPT-4、Claude 等大模型最近回复质量下降
|
|
||||||
- 有人认为是心理作用或期望值提高
|
|
||||||
- 也有人提到可能是模型更新导致的风格变化
|
|
||||||
- 讨论涉及多个主流大模型:GPT-4、Claude、Gemini 等
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 关键回复观点
|
|
||||||
|
|
||||||
1. **心理作用论**: 用多了之后对模型能力边界更清楚,所以感觉"变笨"
|
|
||||||
2. **模型更新论**: OpenAI 等厂商确实会调整模型,可能影响某些任务的表现
|
|
||||||
3. **任务复杂度**: 随着使用深入,提出的问题更难,模型显得力不从心
|
|
||||||
4. **对比效应**: 新模型出来后,旧模型相对显得弱了
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
## 个人思考
|
|
||||||
|
|
||||||
(待补充)
|
|
||||||
|
|
||||||
---
|
|
||||||
|
|
||||||
**原始链接**: https://www.v2ex.com/t/1196441#reply25
|
|
||||||
@@ -1,11 +0,0 @@
|
|||||||
---
|
|
||||||
type: clip
|
|
||||||
created: 2025-08-05
|
|
||||||
source: https://mp.weixin.qq.com/s/cNWUHBjR8GJvtGKIME9ZBg
|
|
||||||
tags:
|
|
||||||
- 战斗
|
|
||||||
- 状态同步
|
|
||||||
- InBox
|
|
||||||
---
|
|
||||||
|
|
||||||
- [介绍状态同步战斗玩法的设计和实现(以移动举例)](https://mp.weixin.qq.com/s/cNWUHBjR8GJvtGKIME9ZBg)
|
|
||||||
@@ -1,20 +0,0 @@
|
|||||||
---
|
|
||||||
title: 测试笔记 - 共享目录转移
|
|
||||||
date: 2026-03-20
|
|
||||||
tags: [测试, 共享目录]
|
|
||||||
---
|
|
||||||
|
|
||||||
# 测试笔记
|
|
||||||
|
|
||||||
这是一篇测试笔记,用于验证共享目录转移流程。
|
|
||||||
|
|
||||||
## 创建信息
|
|
||||||
- 创建时间: 2026-03-20 03:01
|
|
||||||
- 来源: Mac mini 共享目录
|
|
||||||
- 目标: zanepc Obsidian InBox
|
|
||||||
|
|
||||||
## 测试内容
|
|
||||||
如果这篇笔记能成功转移到 zanepc 的 Obsidian 中,说明流程配置正确。
|
|
||||||
|
|
||||||
---
|
|
||||||
*自动创建用于测试共享目录转移*
|
|
||||||
Reference in New Issue
Block a user