Files
obsidian-notes/InBox/_播客__Agent技术周报2_harness工程能力更新_开源agent生态分化_BV1LjdzB3EAu_笔记.md
2026-06-09 10:48:33 +08:00

5.5 KiB
Raw Blame History

Agent技术周报#2Harness工程能力更新与开源Agent生态分化

本周核心主题

Agent开发正从单纯的模型能力竞赛转向更复杂的系统能力构建Harness Engineering脚手架工程成为Agent开发的核心差异化竞争点。

业界共识有用的Agent不是 "just best models",而是以下系统能力的组合:

  • 文件系统访问
  • BSHShell上下文压缩
  • 记忆管理
  • 权限控制
  • 重试机制
  • 评估机制
  • 子Agent协作

趋势预测

预计到 2025年下半年竞争焦点将从模型精度转向整个Agent系统的鲁棒性可观测性

用户核心关注点:

旧关注点 新关注点
单次推理精度 能否持续运行数小时甚至数天
模型是否最聪明 任务中途出错能否自动恢复
上下文理解能力 长对话中是否丢失上下文

Harness工程的技术实践路径

1. 解耦与标准化

代表方案OpenAI Ediness SDK

  • 将Harness逻辑与实际计算存储环境分离
  • Harness本身开源可定制
  • 具体代码执行委托给第三方沙箱环境(如 Modal、CodeFlare
  • 形成 无状态编排 + 有状态隔离工作区 的模式
  • 优势:既安全又灵活

2. 强化控制与护栏

代表方案Lachain DeepAgent

  • 将Agent降级为结构化的工具调用
  • 通过中间件严格的文件系统权限设置护栏
  • 防止Agent行为失控

3. 技能持久化与演化(关键创新)

代表方案HermesAgent

核心思想把Agent成功完成的工作流自动保存为可复用的技能

工作流程:执行 → 成功 → 保存技能 → 可复用 → 持续积累
  • Agent不再是"干完就忘"
  • 能积累经验,越用越强
  • 形成 学习 → 固化 → 复用 的闭环

实际影响

企业层面

  • 部署门槛变化:从"选GPT-4还是Claude"转向"如何设计稳定安全的Harness系统"
  • 云服务商迅速反应Cloudflare、Modal等推出专门的Agent沙箱服务,试图在生态层绑定用户
  • 开源Harness项目正在快速追赶闭源系统的能力

用户层面

  • 更关注Agent的持续运行能力自动恢复上下文保持
  • 衍生新现象:Wing Fatigue持续的审查、修正AI输出带来的精神疲劳
  • 反向推动系统本身需要更可靠、更自动化

开源Agent生态分化

本周焦点开源Agent框架早期百花齐放现在开始像操作系统一样出现清晰的定位分化

主要框架对比

框架 定位 特点 目标用户
HermesAgent 可编程专业Agent 高度可定制、技能持久化、工具箱 开发者和高级用户
Open Interpreter / Open Cloud 即时运行个人助理 记忆导入、Memory Palace、聊天UI优化、视频生成插件 普通用户

HermesAgent本周更新 V0.9 / V0.10

核心功能:

  • 专业的本地Web管理仪表盘
  • 强大的技能持久化功能
  • 丰富的集成能力

典型应用场景:

用户用它自动修复开源模型的底层代码bug → 跑测试 → 生成报告 → 上传到模型社区,全程高度自制。

杀手锏:不是会用工具,而是能固化技能——让Agent从临时工变成有经验的老员工。

Open Cloud

核心功能:

  • 记忆导入
  • Memory Palace
  • 聊天UI优化
  • 视频生成插件集成

定位:更偏向即时运行个人助理,用户体验更友好。

新入局者

框架 特点
OpenAG 开源云编码Agent站
DeepAgent 底层运行1支持可插拔模型、提供商、沙箱、中间件、追踪等

行业格局影响

2025年可能迎来Agent框架的 Linux vs Windows 时刻。

  • 用户根据可编程性需求Hermes方向还是应用性需求Open Cloud方向做选择
  • 开源Agent在可复现性可审计性上的优势凸显
  • 开始吸引对透明度可控性有要求的企业用户
  • 闭源方案GitHub Copilot、Claude Code等仍有先发和集成优势但开源追赶速度非常快

其他值得关注的技术趋势

1. 安全与合规转型

新的架构正在推动审查重点从代码安全转向AI行为安全

  • 结合Git版本管理的存储方案
  • 为Agent所有操作提供审计追踪回滚能力

2. 垂直化与平台化并行

  • 平台化通用Agent平台扩展为Agent工作区
  • 垂直化面向生命科学、网络安全等高价值领域的垂直专业Agent兴起针对特定领域知识深度优化

3. 本地部署加速

  • 将Qwen 3.6模型通过量化技术
  • 可在消费级显卡甚至大内存普通电脑上运行

典型场景:

用户用本地部署的模型分析长达数十万字的个人日记,数据完全不用离开本地,隐私优势无可替代


总结

Agent战场已全面升级从单点模型比拼扩展到整体系统比拼

决定性竞争优势来源

能力 说明
容错性 系统容许组件失败
可恢复性 出错后能自动恢复
可审计性 所有操作可追溯
可演化性 经验积累能力

Harness工程是构建这些能力的核心学科。

  • 开源生态会继续分化,提供不同层级的解决方案
  • 企业及个人用户的选择标准需从"模型智能"转向"模型可靠性"等系统能力