186 lines
5.6 KiB
Markdown
186 lines
5.6 KiB
Markdown
---
|
||
title: "[Milky] 为您整理《[播客] Agent技术周报2,harness工程能力更新,开源agent生态分化》笔记 | BV1LjdzB3EAu"
|
||
source: "milky@4ueo.com"
|
||
date: 2026-06-09 21:17
|
||
tags: [milky, bilibili, notes]
|
||
email_id: 1989
|
||
---
|
||
|
||
Milky 为您整理了《[播客] Agent技术周报2,harness工程能力更新,开源agent生态分化》| BV1LjdzB3EAu 笔记。
|
||
|
||
Agent技术周报#2:Harness工程能力更新与开源Agent生态分化
|
||
|
||
本周核心主题
|
||
|
||
Agent开发正从单纯的模型能力竞赛转向更复杂的系统能力构建,Harness Engineering(脚手架工程)成为Agent开发的核心差异化竞争点。
|
||
|
||
业界共识:有用的Agent不是 "just best models",而是以下系统能力的组合:
|
||
|
||
文件系统访问
|
||
BSH(Shell)上下文压缩
|
||
记忆管理
|
||
权限控制
|
||
重试机制
|
||
评估机制
|
||
子Agent协作
|
||
|
||
|
||
趋势预测
|
||
|
||
预计到 2025年下半年,竞争焦点将从模型精度转向整个Agent系统的鲁棒性和可观测性。
|
||
|
||
用户核心关注点:
|
||
|
||
| 旧关注点 | 新关注点 |
|
||
|---------|---------|
|
||
| 单次推理精度 | 能否持续运行数小时甚至数天 |
|
||
| 模型是否最聪明 | 任务中途出错能否自动恢复 |
|
||
| 上下文理解能力 | 长对话中是否丢失上下文 |
|
||
|
||
|
||
Harness工程的技术实践路径
|
||
|
||
解耦与标准化
|
||
|
||
代表方案:OpenAI Ediness SDK
|
||
|
||
将Harness逻辑与实际计算存储环境分离
|
||
Harness本身开源可定制
|
||
具体代码执行委托给第三方沙箱环境(如 Modal、CodeFlare)
|
||
形成 无状态编排 + 有状态隔离工作区 的模式
|
||
优势:既安全又灵活
|
||
|
||
强化控制与护栏
|
||
|
||
代表方案:Lachain DeepAgent
|
||
|
||
将Agent降级为结构化的工具调用
|
||
通过中间件和严格的文件系统权限设置护栏
|
||
防止Agent行为失控
|
||
|
||
技能持久化与演化(关键创新)
|
||
|
||
代表方案:HermesAgent
|
||
|
||
核心思想:把Agent成功完成的工作流自动保存为可复用的技能
|
||
|
||
`
|
||
工作流程:执行 → 成功 → 保存技能 → 可复用 → 持续积累
|
||
`
|
||
|
||
Agent不再是"干完就忘"
|
||
能积累经验,越用越强
|
||
形成 学习 → 固化 → 复用 的闭环
|
||
|
||
|
||
实际影响
|
||
|
||
企业层面
|
||
|
||
部署门槛变化:从"选GPT-4还是Claude"转向"如何设计稳定安全的Harness系统"
|
||
云服务商迅速反应:Cloudflare、Modal等推出专门的Agent沙箱服务,试图在生态层绑定用户
|
||
开源Harness项目正在快速追赶闭源系统的能力
|
||
|
||
用户层面
|
||
|
||
更关注Agent的持续运行能力、自动恢复、上下文保持
|
||
衍生新现象:Wing Fatigue(持续的审查、修正AI输出带来的精神疲劳)
|
||
反向推动系统本身需要更可靠、更自动化
|
||
|
||
|
||
开源Agent生态分化
|
||
|
||
本周焦点:开源Agent框架早期百花齐放,现在开始像操作系统一样出现清晰的定位分化。
|
||
|
||
主要框架对比
|
||
|
||
| 框架 | 定位 | 特点 | 目标用户 |
|
||
|------|------|------|----------|
|
||
| HermesAgent | 可编程专业Agent | 高度可定制、技能持久化、工具箱 | 开发者和高级用户 |
|
||
| Open Interpreter / Open Cloud | 即时运行个人助理 | 记忆导入、Memory Palace、聊天UI优化、视频生成插件 | 普通用户 |
|
||
|
||
HermesAgent(本周更新 V0.9 / V0.10)
|
||
|
||
核心功能:
|
||
|
||
专业的本地Web管理仪表盘
|
||
强大的技能持久化功能
|
||
丰富的集成能力
|
||
|
||
典型应用场景:
|
||
用户用它自动修复开源模型的底层代码bug → 跑测试 → 生成报告 → 上传到模型社区,全程高度自制。
|
||
|
||
杀手锏:不是会用工具,而是能固化技能——让Agent从临时工变成有经验的老员工。
|
||
|
||
Open Cloud
|
||
|
||
核心功能:
|
||
|
||
记忆导入
|
||
Memory Palace
|
||
聊天UI优化
|
||
视频生成插件集成
|
||
|
||
定位:更偏向即时运行个人助理,用户体验更友好。
|
||
|
||
新入局者
|
||
|
||
| 框架 | 特点 |
|
||
|------|------|
|
||
| OpenAG | 开源云编码Agent站 |
|
||
| DeepAgent | 底层运行1,支持可插拔模型、提供商、沙箱、中间件、追踪等 |
|
||
|
||
|
||
行业格局影响
|
||
|
||
2025年可能迎来Agent框架的 Linux vs Windows 时刻。
|
||
|
||
用户根据可编程性需求(Hermes方向)还是应用性需求(Open Cloud方向)做选择
|
||
开源Agent在可复现性和可审计性上的优势凸显
|
||
开始吸引对透明度和可控性有要求的企业用户
|
||
闭源方案(GitHub Copilot、Claude Code等)仍有先发和集成优势,但开源追赶速度非常快
|
||
|
||
|
||
其他值得关注的技术趋势
|
||
|
||
安全与合规转型
|
||
|
||
新的架构正在推动审查重点从代码安全转向AI行为安全
|
||
|
||
结合Git版本管理的存储方案
|
||
为Agent所有操作提供审计追踪和回滚能力
|
||
|
||
垂直化与平台化并行
|
||
|
||
平台化:通用Agent平台扩展为Agent工作区
|
||
垂直化:面向生命科学、网络安全等高价值领域的垂直专业Agent兴起,针对特定领域知识深度优化
|
||
|
||
本地部署加速
|
||
|
||
将Qwen 3.6模型通过量化技术
|
||
可在消费级显卡甚至大内存普通电脑上运行
|
||
|
||
典型场景:
|
||
用户用本地部署的模型分析长达数十万字的个人日记,数据完全不用离开本地,隐私优势无可替代
|
||
|
||
|
||
总结
|
||
|
||
Agent战场已全面升级:从单点模型比拼扩展到整体系统比拼。
|
||
|
||
决定性竞争优势来源
|
||
|
||
| 能力 | 说明 |
|
||
|------|------|
|
||
| 容错性 | 系统容许组件失败 |
|
||
| 可恢复性 | 出错后能自动恢复 |
|
||
| 可审计性 | 所有操作可追溯 |
|
||
| 可演化性 | 经验积累能力 |
|
||
|
||
Harness工程是构建这些能力的核心学科。
|
||
|
||
开源生态会继续分化,提供不同层级的解决方案
|
||
企业及个人用户的选择标准需从"模型智能"转向"模型可靠性"等系统能力
|
||
|
||
──────────────────────────────
|
||
— Milky 视频总结助手 |