放弃提示词!Harness架构打造120/120满分企业级Agent

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

许多企业级大模型应用在原型阶段表现惊艳,往往只需一段系统提示词加上基础的 检索增强生成Retrieval-Augmented Generation, RAG)就能在演示环境跑通业务逻辑。

ArXiv URL:http://arxiv.org/abs/2607.08028v1

然而一到真实商业环境落地,合规溯源、权限路由和输出审计等严苛要求,会让单纯依赖提示词的系统瞬间崩溃。提示词可以用来“演示”系统的能力,却极其脆弱,根本无法“保证”系统的绝对安全与可控。

针对这一业界痛点,AI Leadership Research Center 在最新论文中提出了一种全新的工程范式。本文提出的 Harness Engineering(外围控制工程)方法,将大模型 Agent 的核心行为控制权从玄学般的提示词中彻底剥离。

该研究通过代码、清单和契约,重塑了完全可追踪、可审计的企业级 Agent 架构,为金融投资等高敏感领域的 AI 落地指明了方向。

隐喻剖析:从“全能主厨”到“计件包装工”

为了讲透本文核心机制的精妙之处,我们可以把企业级知识问答系统比作一座现代食品加工厂

在传统的提示词主导模式下,大模型就像是一个全能主厨。开发者把一堆未经筛选的原始财报和新闻(外部文档)直接丢给它,用自然语言吩咐:“请根据这些材料做一份合规的投资简报”。

这位主厨确实能做出来,但他往往自由发挥。你不知道他具体用了哪家公司的哪一条数据,他甚至可能偷偷加了违禁调料(产生事实幻觉,或给出违规的买卖建议)。这种黑盒操作在企业级审计中是绝对零容忍的。

Harness 架构的核心思想,就是建立一条严苛的现代化流水线,并将全能主厨降级为流水线最末端的包装工人

前端的原材料采购、清洗、质检,以及成品的安全检测,全部由不带任何随机性的钢铁机器(系统代码)来完成。大模型只负责最后一步:用流畅的人类语言把合格的材料“包装”起来。

Refer to caption

核心机制一:严格准入的断言流水线

这座工厂的第一个车间,是解决知识权威性问题的 Source-to-Claim 流水线。单纯的 RAG 机制仅仅检索文档,但无法保证片段的准确性和归属权。

Harness 架构设定了一套极其严苛的知识准入关卡。

首先,所有的外部资料(如官方披露文件、新闻)不能直接进入数据库,必须先注册为源清单(Manifest)。清单会记录下文件的哈希值、提取时间、来源类别和适用策略。

随后,只有经过审查、提取并绑定了来源凭证的原子化信息,才能被晋升为带源断言Source-backed Claims)。

当用户提问时,进入大模型上下文的,不再是大段大段可能包含干扰信息的原始文本,而是被严格限定在实体范围内的“断言集合”。代码决定了哪些事实可以被表述,从根本上切断了模型凭空捏造事实的路径。

核心机制二:可替换的组合边界

架构的第二层精妙设计在于确立了代码与模型的组合边界Composition Boundary)。

在这套系统中,实体路由(匹配用户问的是哪家公司)、断言资格审查、答案结构规划等决定性的业务逻辑,全部由系统原生代码接管。

大模型仅仅通过 API 接入,作为一个可随时替换的组合引擎存在。

该研究为此设计了两套后备方案。如果在线大模型服务宕机,或者其生成的文本无法通过后续的审查契约,系统会立即触发降级机制,调用基于规则的模板引擎(无模型状态)来强制组装答案,从而保证了企业级服务的高可用性。

核心机制三:三大铁律重塑输出契约

包装工人打包好产品后,必须经过质检车间才能出厂。Harness 架构为最终向用户展示的答案制定了三大不可逾越的代码级契约:

  1. 防泄漏审查Leakage Checks):强制拦截任何内部调试标记、追踪记录代码(如 JSON 片段)或 API 诊断信息,防止系统内部状态暴露给最终用户。
  2. 链接连通性Link Checks):答案中引用的每一个观点和后续追问链接,都必须能无缝解析并跳转到最初的公共数据源定位符。
  3. 语言合规性Language Checks):严格约束答案的语气。代码层通过模式匹配,坚决阻断任何类似“买入”、“卖出”或“目标价”等带有主观推荐倾向的危险投资词汇。

实证检验:120/120的满分答卷

该研究在包含韩国五大企业集团(共25家上市公司)的真实公共数据切片上,构建了包含 30 个投资相关场景的严苛测试集。

跨模型稳定性测试(RQ2)

研究团队将组合边界处的模型,在 Claude 3.5 Sonnet、GPT-4o mini 和 Gemini 1.5 Flash 之间进行了高频替换。

在总计 270 次的极限测试运行中,Harness 架构的代码验证器展现出了惊人的稳定性。所有不符合契约的生成失败,都被成功限制在模型组合侧,并被系统代码精准捕获并记录。系统安全性彻底摆脱了对特定模型“指令遵循能力”的依赖。

Refer to caption

消融实验揭示提示词局限(RQ3)

这是本文最具震撼力的对比实验。如果固定底层大模型,仅仅改变外部的约束层,系统表现会有何差异?

当仅仅依赖“纯提示词”来约束模型时,悲剧发生了。模型无可避免地向读者泄漏了内部的追踪日志,更可怕的是,它多次绕过提示词的嘱咐,给出了违规的投资建议。

业界常用的另一种做法是增加外挂式的独立护栏Bolt-on Guardrail)。虽然这种方法成功堵住了违规输出,但它如同一个过于敏感的门卫,引发了极其严重的过度拒绝现象。

实验数据表明,外部护栏直接导致系统的可用答案数量暴跌,整体效用指标降至 88/120,严重影响了业务连贯性。

而在完全相同的压力测试下,Harness 架构凭借其内聚的代码级契约与断言控制,不仅 100% 阻断了所有违规与泄漏风险,更完美保留了全部的有效业务信息,交出了 120/120 的满分可用性答卷。安全与效用在这一刻实现了完美平衡。

工程启示:让Agent开发回归软件工程

这项研究为深陷“提示词玄学”的 AI 开发者敲响了警钟。企业级大模型应用走向深水区,必须回归严谨的传统软件工程体系。

不要再试图用几千字的超长系统提示词来压榨大模型的逻辑推理边界,那无异于在沙滩上建高楼。

提示词应当保持简短、聚焦于语气策略。而复杂的数据路由规则、来源准入清单、数据模式契约以及边界拦截逻辑,必须坚定不移地交还给传统的代码逻辑。

这种设计不仅大幅降低了企业对昂贵、高参数大模型的算力依赖,更重要的是,它为系统吐出的每一个字符,都印上了一份不可篡改、清晰可查的“审计追踪”证明。

局限考量与未来展望

当然,这种高度确定性的工业级架构,不可避免地带来了前期工程复杂度的指数级飙升。

开发团队需要耗费大量精力,去预先定义繁杂的数据模式(Schema)、编写提取器和验证逻辑。这使得该架构在探索初期的开发效率远不及纯提示词的“Vibe Coding”模式。

此外,该论文验证的场景主要侧重于高度结构化的金融投资简报。对于那些高度开放、需要强创造性发散的长文本生成任务,Harness 架构中极为严苛的“断言控制”机制,可能会在一定程度上扼杀模型输出的连贯性与行文丰富度。

但不可否认的是,在金融、医疗、法律等对事实错误“零容忍”的严肃赛道,Harness 架构为从“玩具原型”走向“合规商业产品”提供了一套极具杀伤力的标准答案。它证明了,在企业级 AI 战场上,严谨的代码契约,永远比轻飘飘的提示词更值得信赖。