5.5 KiB
5.5 KiB
Agent技术周报#2:Harness工程能力更新与开源Agent生态分化
本周核心主题
Agent开发正从单纯的模型能力竞赛转向更复杂的系统能力构建,Harness Engineering(脚手架工程)成为Agent开发的核心差异化竞争点。
业界共识:有用的Agent不是 "just best models",而是以下系统能力的组合:
- 文件系统访问
- BSH(Shell)上下文压缩
- 记忆管理
- 权限控制
- 重试机制
- 评估机制
- 子Agent协作
趋势预测
预计到 2025年下半年,竞争焦点将从模型精度转向整个Agent系统的鲁棒性和可观测性。
用户核心关注点:
| 旧关注点 | 新关注点 |
|---|---|
| 单次推理精度 | 能否持续运行数小时甚至数天 |
| 模型是否最聪明 | 任务中途出错能否自动恢复 |
| 上下文理解能力 | 长对话中是否丢失上下文 |
Harness工程的技术实践路径
1. 解耦与标准化
代表方案:OpenAI Ediness SDK
- 将Harness逻辑与实际计算存储环境分离
- Harness本身开源可定制
- 具体代码执行委托给第三方沙箱环境(如 Modal、CodeFlare)
- 形成 无状态编排 + 有状态隔离工作区 的模式
- 优势:既安全又灵活
2. 强化控制与护栏
代表方案:Lachain DeepAgent
- 将Agent降级为结构化的工具调用
- 通过中间件和严格的文件系统权限设置护栏
- 防止Agent行为失控
3. 技能持久化与演化(关键创新)
代表方案:HermesAgent
核心思想:把Agent成功完成的工作流自动保存为可复用的技能
工作流程:执行 → 成功 → 保存技能 → 可复用 → 持续积累
- Agent不再是"干完就忘"
- 能积累经验,越用越强
- 形成 学习 → 固化 → 复用 的闭环
实际影响
企业层面
- 部署门槛变化:从"选GPT-4还是Claude"转向"如何设计稳定安全的Harness系统"
- 云服务商迅速反应:Cloudflare、Modal等推出专门的Agent沙箱服务,试图在生态层绑定用户
- 开源Harness项目正在快速追赶闭源系统的能力
用户层面
- 更关注Agent的持续运行能力、自动恢复、上下文保持
- 衍生新现象:Wing Fatigue(持续的审查、修正AI输出带来的精神疲劳)
- 反向推动系统本身需要更可靠、更自动化
开源Agent生态分化
本周焦点:开源Agent框架早期百花齐放,现在开始像操作系统一样出现清晰的定位分化。
主要框架对比
| 框架 | 定位 | 特点 | 目标用户 |
|---|---|---|---|
| HermesAgent | 可编程专业Agent | 高度可定制、技能持久化、工具箱 | 开发者和高级用户 |
| Open Interpreter / Open Cloud | 即时运行个人助理 | 记忆导入、Memory Palace、聊天UI优化、视频生成插件 | 普通用户 |
HermesAgent(本周更新 V0.9 / V0.10)
核心功能:
- 专业的本地Web管理仪表盘
- 强大的技能持久化功能
- 丰富的集成能力
典型应用场景:
用户用它自动修复开源模型的底层代码bug → 跑测试 → 生成报告 → 上传到模型社区,全程高度自制。
杀手锏:不是会用工具,而是能固化技能——让Agent从临时工变成有经验的老员工。
Open Cloud
核心功能:
- 记忆导入
- Memory Palace
- 聊天UI优化
- 视频生成插件集成
定位:更偏向即时运行个人助理,用户体验更友好。
新入局者
| 框架 | 特点 |
|---|---|
| OpenAG | 开源云编码Agent站 |
| DeepAgent | 底层运行1,支持可插拔模型、提供商、沙箱、中间件、追踪等 |
行业格局影响
2025年可能迎来Agent框架的 Linux vs Windows 时刻。
- 用户根据可编程性需求(Hermes方向)还是应用性需求(Open Cloud方向)做选择
- 开源Agent在可复现性和可审计性上的优势凸显
- 开始吸引对透明度和可控性有要求的企业用户
- 闭源方案(GitHub Copilot、Claude Code等)仍有先发和集成优势,但开源追赶速度非常快
其他值得关注的技术趋势
1. 安全与合规转型
新的架构正在推动审查重点从代码安全转向AI行为安全
- 结合Git版本管理的存储方案
- 为Agent所有操作提供审计追踪和回滚能力
2. 垂直化与平台化并行
- 平台化:通用Agent平台扩展为Agent工作区
- 垂直化:面向生命科学、网络安全等高价值领域的垂直专业Agent兴起,针对特定领域知识深度优化
3. 本地部署加速
- 将Qwen 3.6模型通过量化技术
- 可在消费级显卡甚至大内存普通电脑上运行
典型场景:
用户用本地部署的模型分析长达数十万字的个人日记,数据完全不用离开本地,隐私优势无可替代
总结
Agent战场已全面升级:从单点模型比拼扩展到整体系统比拼。
决定性竞争优势来源
| 能力 | 说明 |
|---|---|
| 容错性 | 系统容许组件失败 |
| 可恢复性 | 出错后能自动恢复 |
| 可审计性 | 所有操作可追溯 |
| 可演化性 | 经验积累能力 |
Harness工程是构建这些能力的核心学科。
- 开源生态会继续分化,提供不同层级的解决方案
- 企业及个人用户的选择标准需从"模型智能"转向"模型可靠性"等系统能力