Meta-Harness:模型 Harness 的端到端优化

Meta-Harness:模型 Harness 的端到端优化

大语言模型(LLM)系统的性能不仅取决于模型权重,还取决于其 Harness:决定存储、检索和呈现给模型哪些信息的代码。然而,Harness 在很大程度上仍然依赖手工设计,而现有的文本优化器(text optimizer)与该场景匹配不佳,因为它们对反馈的压缩

打开源文档

这一篇来自 Harness Engineering 源仓库的“延伸精读”部分。站内版本会先把背景讲白,再用图表和清单帮你把原文观点落到自己的 AI 协作流程里。

大语言模型(LLM)系统的性能不仅取决于模型权重,还取决于其 Harness:决定存储、检索和呈现给模型哪些信息的代码。然而,Harness 在很大程度上仍然依赖手工设计,而现有的文本优化器(text optimizer)与该场景匹配不佳,因为它们对反馈的压缩过于激进:要么无记忆,要么仅依赖标量分数,要么将反馈限制在简短模板或摘要中。我们提出 Meta-Harness,一个通过搜索 LLM 应用的 Harness 代码来进行优化的外循…

AI 评测、测试和质量护栏无文字插图
文内插图:用测试、检查项和监控信号守住 AI 生成结果的边界。

项目页面及交互式演示:https://yoonholee.com/meta-harness/

延伸精读1 引言2 相关工作3 Meta-Harness:优化 Harness 的 Harness4 实验4.1 在线文本分类
这张图只取自源文档的小标题,用来帮助读者先看清原文结构,再进入教程化拆解。

零基础先抓住什么

阅读位置原文在说什么读者可以怎么检查
开头段落大语言模型(LLM)系统的性能不仅取决于模型权重,还取决于其 Harness:决定存储、检索和呈现给模型哪些信息的代码。然而,Harness…先用一句话复述原文要解决的问题。
1 引言这一节是原文展开论证的关键节点。看它给的是概念、案例、流程,还是失败教训。
2 相关工作这一节是原文展开论证的关键节点。看它给的是概念、案例、流程,还是失败教训。

把原文拆成学习步骤

  1. 先确认它属于“延伸精读”:这一类内容通常用于补背景、补方法,或补真实案例。
  2. 阅读“1 引言”:记录它和本文主题“Meta-Harness:模型 Harness 的端到…”的关系。
  3. 阅读“2 相关工作”:记录它和本文主题“Meta-Harness:模型 Harness 的端到…”的关系。
  4. 阅读“3 Meta-Harness:优化 Harness 的 Harne…”:记录它和本文主题“Meta-Harness:模型 Harness 的端到…”的关系。

可以直接复用的要点

  • Best-of-N:从种子进行独立采样,无搜索结构;一个计算量匹配的对照,用于验证搜索是否有价值。
  • OpenEvolve [^42]:使用 LLM 变异的程序演化搜索。
  • TTT-Discover [^53]:我们仅使用其方法中的文本优化组件,即通过 PUCT 复用规则进行提议选择。
  • 阶段 1:草稿。检索 5 个最近邻的已标注样本,请求初始预测。
  • 阶段 2:验证。基于草稿标签进行条件检索,然后同时展示支持和挑战性样本,再做出最终预测。