Files
obsidian-notes/3Resources/AI/清华大学 驾驭工程 Harness Engineering 研究报告.md
2026-05-29 17:25:07 +08:00

476 lines
28 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 清华大学:驾驭工程 (Harness Engineering) 研究报告
> 来源GIS极客 · 微信公众号
> 日期2026年4月10日
> 原文https://mp.weixin.qq.com/s/EdVjZuBVcXjd30TpxyLsXQ
> 完整报告下载:关注公众号 **GIS极客**,后台回复 **"清华HarnessEngineering"** 获取下载链接
Visual: [[清华大学 驾驭工程 Harness Engineering 研究报告.visual]]
---
## 提取说明
这次按“每张图 = 一个模块”重组。
- 图片已下载到 `清华大学 驾驭工程 Harness Engineering 研究报告.hires/`
- 每个小节对应一张原图
- 小节标题优先按图片主标题人工整理
- 正文尽量保留 OCR 全文,只做了轻度空格清洗
风险:
- OCR 对英文、链接、少数专有名词和局部排版仍有误识别
- 个别页图像里有示意图、图标或多栏布局,转写会比纯段落页更差
- 如需完全准确版本,仍应以对应原图为准
---
### 驾驭工程Harness Engineering研究报告
页码:`page-01.jpg`
驾驭工程 (Harness Engineering) 研究报告一下 0 乁《电脑日志面板 Agent 核心判断:驾驭工程是操作系统层提示词工程是语言层智能体工程是工作流层;驾驭工程是操作系统层。对象:高自治、长时程、可治理的 A 係统丨 26 年 26
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-01.jpg]]
---
### 清新研究团队简介
页码:`page-02.jpg`
· 领导学术研究团队近 30 人。指导大数据、 AI 、人形机器人等多个产业团队。冫目视频号: @清新研究;公众号: @清新研究九 | 司月沈阳:清华大学新闻学院 / 人工智能学院双聘教授、博导 · 团队坚持:整体主义、实证主义、社会建构、进步主义。 " 六大研究方向: 。 1 A 吠模型理论与哲学 4 · 新媒体与网络舆论网邮箱: 124739259@q q ℃ om 圈 oo 囗囹 00 囗 2 · AI 文艺回。 回回 回回彗 3 A | 应用 6 × R 应用丨微博: @ 清新研究 | 公众号: @ 清新研究
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-02.jpg]]
---
### 全文结构目录
页码:`page-03.jpg`
全文结构目录术语状态 从术语状态 ,按“定义一证据一结构一落地”展开。结构 · 四层链条到 “ · 它和提示词 / 上下刘智能体工程的边界是什么证据。第一部分回答“ · 。这个词现在是什么落地 · 中国落地路线 “ · 按“定义一证据一结构一落地”展开。 @ 清新研究团队 | 2026 年 3 月 2
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-03.jpg]]
---
### 一句话结论
页码:`page-04.jpg`
一句话结论总判断驾驭工程不是把提示词再写长一点,而是把模型周围整个制度化执行环境设计出来 0 怎么让型动起来怎么说清 0 一模型提示词工程 - 智能体工程程制杂“提示词工程解决“怎么说清楚” 0 。智能体工程解决“怎么让模型动起来” 0 @ 淆究团队《 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-04.jpg]]
---
### 四层链条:从语言到操作系统
页码:`page-05.jpg`
四层链条:从语言到操作系统驾驭工程核心观点提示词工程、上下文工程、智能体工程、骘驭工訴一互斥关系,而曰层上语言层关注指令表达,上下文层关注状态供给 > 上下文层语言层智能体工程关注状态供给关注指令表达 @ 清新研究团队 | 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-05.jpg]]
---
### 第一部分:术语状态
页码:`page-06.jpg`
第一部分 | 术语状态葳至 2026 03 一 26 、 、 、 、 \ 术语状态冫当前术语体系基本稳定,关键定义待进一步明确。 @ 清新研团队 | 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-06.jpg]]
---
### 它不是教科书术语,但已被前沿团队反复使用
页码:`page-07.jpg`
它不是教科书术语,但已被前沿团队反复使用术语状态 H4R § S 卪 48 q 2026 02m OpenAl 在 2026 02 · 11 明确使用 harness en.. 这说明它已进入一线工程实践话语。早些时候近期、 、 、 、 、 、 、乛工程博客时间轴但它仍在形成中,边界尚未像“数抿库”或“擞。服务”那样冻结。 0 边界仍在探索和定义中。数据库徼服务歡櫷源: https濯0些na靴om刑e对ha賺翰e哣谳丽g/ httpsflwww.anthtopic.com/engineering/effective-harnesses-for-lcng-running-agents https//www.arthropic.wm!engineering/harness-design-lcng-running•apps
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-07.jpg]]
---
### OpenAI 为什么叫它 Harness Engineering
页码:`page-08.jpg`
OpenAI 为什么叫它 Harness Engineering OpenAI 证据五个月后仓库达到约百万行 0 仃人工代码启动 OpenAI Codex 实验场景 HARNESS 估算开发时间 0 ENGINEERING 约为手写的 1 / 10 丿 OpenAI 的核心变化是:工程师的主业不再是手写代码代码库
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-08.jpg]]
---
### Anthropic 为什么持续谈 Harness
页码:`page-09.jpg`
Anthropic 为什么持续谈 Harness Anthropic 证据一亠一亠 Anthropic 的实践把 harness 从抽象口号压成 2025 · 11 的文章聚焦长时程会话,@@鄱 2026 · 03 的文章把 harness design 推到长时程“祀一数据源: https://mvw anthropic.com/engineering/effective-harnesses-for- long-running-agents https://www anthropic.com/engineering/harness-design-long-running-apps
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-09.jpg]]
---
### 为什么“现在”突然重要
页码:`page-10.jpg`
7 回答问丿聊天气泡因为模型已跨过“回答问题”的门槛为什么“现在”突然重要 · OpenAI 己把 agents 定义为能完成从简单目标到开放式完成开放式任务 工作台 · Anthropic 区分 workfl ow 一 agent 数据来源: https:!/developers.openai.com/api/docs/guides/agents https://www.anthropic.com/engineering/building-effective-agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-10.jpg]]
---
### 瓶颈已经从“生成更多”转向“让人只在高杠杆节点出手”
页码:`page-11.jpg`
瓶颈已经从“生成更多”转向“让人只在高杠杆节点出手”瓶颈变化 1 优先级判断节点出手代码吞吐 (Code Throughput) OpenAI 公开写道,随着代码吞吐上升,瓶颈变成了 human QA• 这意味着系统设计的目标不再是“让多做点” 2 · 3 0 LOW SCARCE 人类注意力 (Human Attention) EXECUTIVE SUMMARY HUMAN QA BOTTLENECK 关踺高杠杆节点
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-11.jpg]]
---
### 中国落地窗口已经形成
页码:`page-12.jpg`
中国落地窗口已经形成 10 介 1408 亿元数字经济体量与增长 2024 年数字经济核心产业增加 11 。 08 亿人川 24 年我国同民換 / ' | 人工智能 + 未来驱动引擎互联网昔及率、网络规模与普及率。中国政策、网络规模与数字经济体量力数源智龍应用础彘施体生膚 0 过 · 2024 年数字经济核心产业增加值 140891 亿元。 2024 年我国网民规模 11 08 亿人,互联网普及率 78 6 蟲樾睾:卜 ttpc / 艹虱“ / 。伍 2St2n 却 25 旧 0 四 62m htA ;卜 t 丿 / “ “ “ 《 “伍。 ti ' 丿闸。叫 /VS 馴 34 117 四 恒靼刀 - “ m “彐“ ' n “ 6 / - 加“ 3 / 20 理 ms3103 仆。 。 。 / 心 03 02 312 n8 ht
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-12.jpg]]
---
### 第二部分:四层链条
页码:`page-13.jpg`
02 第二部分丨四层链条先厘清层级边界,才能避免把所有能力混叫成噁严《四、自主 (Autonomy) 、协作 b “薹础词 @ 清新研究团队丨 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-13.jpg]]
---
### 提示词工程:语言层
页码:`page-14.jpg`
0 提示词工程:语言层提示词工程定义 · OpenAl 仍把 prompt engineering 定义为 它解决的是“怎么说清楚” · 重点包括角色设定、输出格式、上法、示例组织一臼令优先级指令纸( SYSTEM PROMPT) 、系统提示 (SYSTEM PROMPT) 色设定 你是一个专业的 A 勵手 · 上下给法:基于以下信息“格式约束 (FORMAT CONSTRAINTS) 出格。请使用 Markdowm 指先级:请优先执行, 示例组织 EXAM PLES )示 1 :用户输入“ A | 输出“示例 2 丿 0 数据来源: https://developers.openai.com/api/dcxs/guides/prompt-engineering https://developers.openai.com/api/docs/guides/prompt-engineering
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-14.jpg]]
---
### 提示词工程的能力边界
页码:`page-15.jpg`
提示词工程的能力边界提示词工程边界(单轮任务) g 单轮生成 0 结构化输出 0 风格一致性和清晰遵循验收(刀当任务是短时、闭环、单步可验收时,提示词工程往往已经够用。很多团队在这里就能拿到很高 ROI ,不需要急着上 Agent0 数扼来源: https://developersopenai.com/api/docs/guides/prompt-engineering https://wwwnnthropic.com/engineering/building-effective-agents 复杂长时程任务(挑战与限制)严 2 @ 多步推理与起忆 × ?外部工具交互 × × @ 动态环境适应外部数据错反馈面临长时程、多目标、需持续交互的任务时,单纯提示词工程能力不足,需要引入 Agent 等更复杂系统。
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-15.jpg]]
---
### GPT-5.4 之后,提示词重点被推向“契约化”
页码:`page-16.jpg`
GPT-5.4 之后,提示词重点被推向“契约化”提示工升 OpenAl 最新指导把高杠杆提示尹词变化概括为 output cont•• 这说明提示词工程并没有消失,而是在向可执行契约演化。 。提示词不再只是“写得像人”而是开始承担流程控制语义 0 數抿耒源: https://developers.openai.com/api/docs/guides/prompt-guidance/ 0 目标状态孑终止信号 S\JCCESS \ 具体的准确度数完成条件凵逻辑约刺 (Completion Conditions) nput/output protocol, 工具期待 (TOOI Expectations) database and interfaces JSON 」 5 4 function calls with 咿 predefined parameters 输出契约 (Output Contracts) Fixed output format Fixed output format
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-16.jpg]]
---
### 规划、前导语与过程可见性
页码:`page-17.jpg`
PLAN 0 0 计划 MILESTONE 确定目标与步驟规划、前导语与过程可见性工具前导语工具系统区分指息 0 前导语 PREAMBL OpenAl 针对 agentic tasks 强调:对长时或重工具流程 preamble 让模型在调用工具前说清意图。工具调用 TOOL CALLS 0 执行操作,与外部系统交互阶段更新 PHASE UPDATES phase 则帮助系统区分中间 commentary 与 fina. 完成 COMPLETE 达到预期鲒果数塘源: https://dwelopers.openaicom/api/docs/guides/prompt-guidance/
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-17.jpg]]
---
### 隐藏中间层:上下文工程
页码:`page-18.jpg`
03 隐藏中间层《上下文工程如果提示词工程管“说什么” ,上下文工程就管“喂什么”管“说什么”提示词工程 @ 清澌研究团队丨 2026 年 3 月 26 日 Context Engineering 管“喂什么” 0 0 、 0 上下文工程
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-18.jpg]]
---
### 上下文工程:隐形内核
页码:`page-19.jpg`
上下文工程:隐形内核上下文工程定义睾 Anthropic 明确把 context engineering 视核心问题不再只是 system p rom pt · 它包括系统指令、工具、外部数据、消息历史、 MCP 、长期状态等。外部数据消息历史上下文状态球体 0 提示 MCP 长期状态数据来源: https://www.anthropic.com/enqineerinq/effective—context—enqineerinq—for-ai-aqents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-19.jpg]]
---
### 上下文是关键但有限的资源
页码:`page-20.jpg`
上下文是关键但有限的资源上下文有限搋挤 0 0 上下文物理边界上下文窗囗不是抽象参数,而是 Agent 能否保持一致行为的物理边界。 02k / 128k USED 上下文预算占用情况任务本身关键约束 ,上下文一旦拥挤,任务本身、关键约束和新证据就会互相争枪注龜力。 。 ` Anthropic: 、 。 。长时代理策略 Anthropic 直接指出:长时代理需要不断展与压上下文。不断策展信息筛选压缩上下文立净内存数据来源: https://www、*
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-20.jpg]]
---
### 上下文状态由什么组成
页码:`page-21.jpg`
上下文状态由什么组成上下文状态组成系统指令定义高优先级规则。孑历史回@ 完整的交互记录。 0 工具决定模型看见哪些动作可能性。摘要精炼的关键信息。 ?乙 外部数据提供世界知识。长期状态持久记忆与个性化。 O 蚴模型入 0 一动作 响应在多轮代理里,真正进入模型判断的不只是聊天记录。数来源: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-21.jpg]]
---
### 为什么上下文会“腐烂”
页码:`page-22.jpg`
为什么上下文会“腐烂”么卧上下文腐烂一, vs 、 一上下文腐烂是今明确目新鮮。越长的会话越容易出现辶状态漂移、通漏、过时规则残留和局部模式俣旧指令可能遮蔽新目标。冗长历史会让穫型把局部线索误当全局事实。 。越长的会话越容易出现状态漂移、違、过时规则残留和局聾式课。旧指令可能遮蔽新目标。 。冗长历史会让樓型把局部线索误当全局事实。随着时间推移,上下文质量下降 @ 数握来源: htfps //wwwnnthr叩ic.com/engineering/effective-context-engineering-for-ai-agents 乜时“腐对上下
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-22.jpg]]
---
### 上下文工程是内核,驾驭工程是外壳
页码:`page-23.jpg`
上下文工程是内核驾驭工程是外壳飞上下文与 Harness 区别 · 我的判断是: context engineering 管“喂给模型什么” · 前者解决状态供绐。 · 后者解决状态之外的契约、权限、回滚、审计和熵控内核与操作系统外壳的分层图外郜交互与訾控外壳驾驭工契约与奴限外部交互与管筏回与版本控制、数与状态流向模型 管蛤摟型什么”解决状共蛤《 0 》审计与监 \ 崆制与隐足性内核 (Core) :上下文工程 (Context Engineering) 知 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-23.jpg]]
---
### 第三部分:智能体工程过渡
页码:`page-24.jpg`
第三部分刂智倻工智能体工程过渡当模型开始带工具、多轮行动并动态选择路径,问题就从“ " 变成“工作流 " 任分稱 0 划,皿、丿司动态选径工作流 @ 清新研究团队丨 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-24.jpg]]
---
### 智能体工程:工作流
页码:`page-25.jpg`
智能体工程 0 工作流智能体工程定义工作流画布一, Guardrails 安全护栏记忆 / 知识。 OpenAI 把 agents 定义为能从简单目标走到复杂开放式工作流“ · 智能体工程的关注点是让模型动起来。其核心对象包括模型、工具、记忆 / 知识、 guardrails 、控制流“控制流数据源: https://developers.openai.com/api!docs/guides/agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-25.jpg]]
---
### AnthropicWorkflow 与 Agent 不是一回事
页码:`page-26.jpg`
Anthropic: Workflow 与 Agent 不是一回事 workflow vs agent Workflow (预定义代码路径) Anthropic 的区分非常关键: workflow 走预定义代码路径 ' 前者更可预测。定性流程图 (Deterministic Flowchart) Sturt Step 1 0 1 dition Step 2 2 No Step 3 (步 0 3 End )数据来源: Agent (动态决策路径)后者更灵活,也更难验证和治理。 Decision? Environment 惭境)动态决路径 (Dynamic Decision path) https://www anthropic.com/enginæring/building-effective-agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-26.jpg]]
---
### OpenAI Agent 架构的六个要件
页码:`page-27.jpg`
OpenAI Agent 架构的六个要件 Agent 架构 Agent 不是只有模型这说明 agent eng i neering 已经是一套系统工程。单个模型再强,也需要被放进工作流与保护层。模型 LLM/Core APIs/Functions 0 guardrails Safet /Poli 知识 Memo /Retrieval 逻辑 Reasonin Plcnni 评测 Evaluation/Testing 数据来源: https://developers.openai.com/api/docs/guides/agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-27.jpg]]
---
### 工具不是 API 包装,而是给 Agent 的动作契约
页码:`page-28.jpg`
侄具不是 API 包装,而是给 Agent 的动作契约工具设计工具面板 / ' · Anthropic 反复强调 动作契约 0 0 ' 00@夢 0 工具需要被当成“给非确 0 - AgenV (Action Contract) 0 丰富信返回上下文理纭采 (Return Context) Token 效率优化输入输出,节省成本工具描述准确指引,明确能力定性代理看的软件契纟勺 " 来设计。 · 名字空间、返回上下文、 token 效率与工具描述都会影响表现。亻囫 0 数源 https://www.anthropicxom/engineering/writing-tools-for-agents@
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-28.jpg]]
---
### 为什么工具层开始从“直接调用”转向“写代码调用”
页码:`page-29.jpg`
为什么工具层开始从“直接调用”转向“写代码调用” MCP 与代码执行 0 Anthropic 在 MCP 文章中指出,直接工具调用会消耗上下文; 。 Agent 可以通过代码把复杂任务分解为更经济的执行路径。 0 工具定义 0 更强代理代码执行 MCP (Model Context ProtocoI) 核心价值艹厂囗囗囗复杂任务分解精确检索与执行数扌居 源: https //www anthropic.com/engineering/code-execution-with-mcp
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-29.jpg]]
---
### 没有 eval 的 Agent只是会行动的黑箱
页码:`page-30.jpg`
没有 eval 的 Agent, 只是会行动的黑箱评测回路 | 身 Anthropic 在 eval 文章中强调匚 / 单轮。 “吧不足以覆盖长时代囗囗理 grader 生产监控、自动评测、 B 、人工审阅要形成多层防线。任务一反馈。代理 0 数来: https:hwww.anthropic.com/engineering/demystifying-evals-for-a卜agents 、一二《 《 《 《一一
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-30.jpg]]
---
### 第四部分:制度层
页码:`page-31.jpg`
4 制度层当提示、上下文、工作流都不够解释问题时,剩下的就是制度层。 @ 清新研究团队丨 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-31.jpg]]
---
### 驾驭工程的严格定义
页码:`page-32.jpg`
驾驭工程的严格定义契约工具验证严格定义标契约高自治 AI 模犁记忆安全舒围绕高自治 AI 构建整套可持续执行环境一目标契约了@ 一一, 。目标不是让模型“会做事” 。它是系统级环境设计,而不是单点技巧集合。 x 、一一,一一 一一一一二一一一一一一 一 @清新研究团队 | 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-32.jpg]]
---
### 为什么我把它定义为“操作系统层”
页码:`page-33.jpg`
为什么我把它定义为“操作系统层” 0 为什么是 OS 层 Agenth 统架构户愉入只是输入接囗操作系统分层图: Agent 世界对照因为它不只决定一次输出,而是决定任务如何被启动语言层只是输人接口。工作流层只是动作编排。工作流排作盈引操作系统层( OS 层)核心:决宸任芳如何被启动只是动作苤悱因为它不只决定一次輸出任务划权督理状记亿存实时监窪 A nt 执行与环境传操作系 OS 用户应用层 Shell/APlä 核 (OSE) 文件系統 / 调度件夤膊层 Agent 世界 OS 用户指令 / 应用 - 语盲 / 工作流口 OS 层 (Agent OS) 任身观划与拽行能力与衩记亿与状态訾理行力监与安全执环境与工具 @ 新研壳团队 | 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-33.jpg]]
---
### 它不是替代提示词工程,而是对它的上卷
页码:`page-34.jpg`
它不是替代提示词工程,而是对它的上卷,不是替代关和而是对它的上卷驾驭工程 Age nt Prompt ResuIt Context Prompt · 因此 "prom 死”这种说法并不成立。 真正的变化曰 rompt 不再是全部,驾驭工程把 prompt 、 context 、 agent 而刂度层中的一个部亻。全部吸纳进去清新研究团队丨 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-34.jpg]]
---
### 六个负重部件总览
页码:`page-35.jpg`
六个负重部件六大负重部件总览本报告把驾驭工程拆成六个必须被工程化的负重部件。 1 机器可验证的完成契约 CONTRACT g-O · 机器可验证的完成契约。 4 [Component 4 Name] · [Brief description Of component 4 ] 2 DurabIe KnowIedge 的 System of Record 0 REC · durable knowledge 的 system Of rec•• 5 CComponent 5 Name] · [Brief description Of component 5 @ 清新研究团队丨 2026 年 3 月 26 日 3 、 [Component 3 Name] 0 · [Brief description Of component 3 ] 6 [Component 6 Name] · [Brief description Of component 6
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-35.jpg]]
---
### 部件一:完成定义必须可机器验证
页码:`page-36.jpg`
部件一:完成定义必须可机器验证 0 完陇契约清单 .Com letion Contract Checklist) 团队原创定义 0@ 1 输出格 (Output Format) 一预定数据结掏与相式范 2 工具使用仃 00 | Usage) 一指定工具调用与交互流程 3 停止条件 (Stopping Conditions) 一明确终止触发与边界倩况 4 验收方法 (Acceptance Methods) 一自动化测试与正准则 SON ERROR 。 OpenAl 的提示指导和 Codex 实践都把 "what done 灬不是漂亮回答,而是可验证完成。 -p ,拳一孑 Done ” 0 。契约里应包含输出格式、工具使用、停止条件和验收方法。数据来溽: https://develogærs.openai.com/api/docs/guides/prompt-guidance/ https://openai.com/index/harness-engineering/
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-36.jpg]]
---
### 部件二:知识必须成为 system of record
页码:`page-37.jpg`
部件二一个巨大的 AGENTS.md 团队原创定义知识必须成为 s stem of record 仓库 GoogIe DOCS 对 Agent 来说,不在仓库里的 Google Docs 部件二知识必须可发现知识必须可验证知识必须可维护数源: https//openai.com/index/harness-engineering/ https://www.anthropic.com/engineering/effective-context-engineerirg-for-ai-agents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-37.jpg]]
---
### 部件三:必须给 Agent 真正的感官和手脚
页码:`page-38.jpg`
团队原创定义部件三:必须给 Agent 真正的感官和手脚 0 t 亠 00 囗 UI (浏览器)指标 (Metrics & Traces) Agent 日志 (Log) 终端 (Terminal & 测试) · 0penAI 给 Codex 接了 UI 、日志、指标和 traces · 只有能读 UI 、看日志、跑测试,代理才有资格自证完成。 · 仅靠读代码和口头声明,很难发现真实 bugo X @ https://www.anthropic.com/engineering/harness-design-long-running•apps
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-38.jpg]]
---
### 部件四:必须解决长时程失忆
页码:`page-39.jpg`
部件 四! ;必须解决长时程失忆《部件可长时任务不能只靠大上下文硬扛。 0 0 @进葭文件 git feature 团队原创定义关键是让状态可恢复、可交接、可继续。 Anthropic 的 [ 0n9 一 running harness 用长时任务不能只靠 0 大上下文硬扛。 0-0 0 关键是让状态可恢复、可交接、可继续。数提来源: https//www.anthropic.com/engineering/effective-harnesses-for-long-running-cgents https://wwwnnthropic.com/engineering/harness-design-long-nmning-apps 一 一一 一一一一一一 = 二二一
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-39.jpg]]
---
### 部件五:验证必须外置成回路
页码:`page-40.jpg`
Generator 、部件五:验证必须外置成回路部件五外部 evaluator 0 负责不相信主 agento 丶夕团以原创定义 valuator 'Playwrigh@P 加黿怙@ 冶同式 d 数据来源 p § 凹山四些国在四!些 gg / 《 ;匹, https://www.anthropic.com/engineering/demystifying-evals-for-ai-aqents
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-40.jpg]]
---
### 部件六:边界、沙箱与熵控制必须机械化
页码:`page-41.jpg`
部件六:边界、沙箱与熵控制必须机械化部件八 lnput C0de & Data 0 沙箱 lint 彡风格 (Style) 风格、架构和安全不能只存在于人腌审美里。要把 taste 、 risk 和架构 governance 写进 lin••• (Architecture) 一安全 (Security) taste - risk governance Approved 团队原创定义 90 / 100 质量分 OpenAI 用 lint 回收站数来源: https://openai.com/index/harness-engineering/; https://www.anthropic.com/engineering(claud&éödé-sandboxing
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-41.jpg]]
---
### 驾驭工程最深一层是注意力工程
页码:`page-42.jpg`
驾驭工程最深一层是注意力工程 0 0 0 HUMAN TIME & ATTENTION 訓亠 0 正稀缺资 ' 0 HIGH AI CAPABILITY 匡 00 驾驭工程的真正目标不是把 AI 变得更像人。低价值环节可井行妊务自动纠针刈 M 姓 0 VALUE CREATION 目标 0 0 0 一 0 OpenAl 明确说,真正稀缺趵是 human time and at 人类注意力漏斗 0 而是把人从低价值、可并行、可自动纠错环节中抽离》始意力创造性工作; ' 战略决策核心价值创造自动化过滤 & AI 辅助鼓据来源: ht:ps://openücom/index/harness engineering/
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-42.jpg]]
---
### 人的角色发生了什么变化
页码:`page-43.jpg`
人的角色发生了什么变化角色变化 BEFORE: 表达者 ()x resser) " “ 0 、 @》乸》 。在提示词工程里, e 四 ee 疗四人主要是表达者;提示词工程。人的工作抽象层上模糊目标伊 Goal) Focus cra 厑 9 叩 u 区 specific outputs. 又@ 清新研究团队 AFTER: 设计者 & 抽象层上移。要把模糊目标翻译成 acceptance criteria; · 人的工作重点转向系统设计与评估。 = acceptance criteria (验收标准) Focus 虎 9 system behavior and 諂毹 e 忉 e 忉 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-43.jpg]]
---
### 驾驭工程真正要求的是组织能力,不只是模型能力
页码:`page-44.jpg`
驾驭工程真正要求的是组织能力,不只是模型能力组织能力真正稀缺的,不再是会不会写 prompt ,而是能不能把人类判断制度化产品( Product) · 需求 & 定义蚴。价值发现实台理 (Governance) 0 。合规 & 风险组织能力协同引擎工程 (Engineering) 蛉。构建 & 实施。技术卓越 0 运营 (Operations) | · 维护 & 优化 · 持续改进 t · 标准制定。组织需要产品、工程、治理、运营协同。 · 单点高手可以做 demo ,系统化团队才能做长期稳定生产。 @ 清新研究团队 ] 2026 年 3 月 26 日
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-44.jpg]]
---
### GIS 极客尾图
页码:`page-45.png`
GIS
![[清华大学 驾驭工程 Harness Engineering 研究报告.hires/page-45.png]]