近日,翁荔發(fā)布長(zhǎng)文 《Harness Engineering for Self-Improvement》,系統(tǒng)梳理了 harness engineering 在 AI 自我改進(jìn)中的作用。她指出,原始模型與真實(shí)世界任務(wù)之間的 harness layer 正在變得和模型本身一樣重要:它決定模型如何規(guī)劃、調(diào)用工具、管理上下文、保存狀態(tài)、評(píng)估結(jié)果,并在長(zhǎng)期任務(wù)中持續(xù)迭代。
(相關(guān)資料圖)
這也揭示了當(dāng)下 LLM Agent 研究中的一個(gè)關(guān)鍵轉(zhuǎn)向:Agent 的能力提升不再只來自模型參數(shù)更新,也越來越來自模型外部系統(tǒng)的演化。Prompt、memory、tools、workflow、middleware、permission control、runtime state 等組件共同構(gòu)成 agent harness,而這些組件正在成為自進(jìn)化系統(tǒng)的核心優(yōu)化對(duì)象。
但隨之而來的問題是:如果 Agent 會(huì)不斷修改自己的 harness,我們應(yīng)該如何評(píng)測(cè)這種「自我改進(jìn)」?
現(xiàn)有 Agent benchmark 大多仍然面向靜態(tài)系統(tǒng):給定一個(gè)固定 Agent,在一組獨(dú)立任務(wù)上運(yùn)行,然后報(bào)告最終成功率。這種評(píng)測(cè)方式無法回答 harness evolution 中更關(guān)鍵的問題:一次更新到底改進(jìn)了什么?提升是否能遷移到未見任務(wù)?是否只是過擬合近期反饋?是否遺忘了舊能力?是否引入了更高成本或運(yùn)行時(shí)不穩(wěn)定?
針對(duì)這一評(píng)測(cè)空白,清華大學(xué)團(tuán)隊(duì)提出了 SEAGym: An Evaluation Environment for Self-Evolving LLM Agents。
如果說 harness engineering 正在成為自進(jìn)化 Agent 的重要技術(shù)路線,那么 SEAGym 關(guān)注的就是這條路線的評(píng)測(cè)基礎(chǔ)設(shè)施:不只評(píng)估 Agent 最終得了多少分,而是評(píng)估它在更新過程中如何變強(qiáng)、何時(shí)退化、是否泛化、是否遺忘,以及付出了什么成本。
論文標(biāo)題:SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
論文地址:https://arxiv.org/abs/2606.17546
代碼地址:https://github.com/antropy-research/SEAGym
從靜態(tài) benchmark 到動(dòng)態(tài)自進(jìn)化環(huán)境
SEAGym 將自進(jìn)化 Agent 形式化為一個(gè)和強(qiáng)化學(xué)習(xí)算法訓(xùn)練過程對(duì)齊的評(píng)測(cè)過程。
每個(gè) Agent snapshot 被表示為:。其中 M 是固定的基礎(chǔ)模型和不可變運(yùn)行組件,是可更新的 harness state,包括 prompts、memories、skills、tools、middleware、runtime configuration 等。
在每一步中,環(huán)境采樣一批訓(xùn)練任務(wù),Agent 在這些任務(wù)上執(zhí)行,產(chǎn)生軌跡和反饋,然后根據(jù)自身的更新規(guī)則修改 harness:
這里,SEAGym 并不規(guī)定具體的更新算法。不同自進(jìn)化方法可以保留自己的 native update rule,只需要通過統(tǒng)一的 rollout /update interface 接入即可。
這種設(shè)計(jì)使得 SEAGym 可以在同一套協(xié)議下比較不同類型的自進(jìn)化方法,例如:
ACE:主要積累 prompt-visible skillbook 或過程經(jīng)驗(yàn);
TF-GRPO:利用 grouped rollout evidence 更新 experience/context store;
AHE:直接編輯更廣義的 agent harness,包括 prompts、tools、middleware 和 runtime 行為。
另外,通過將 agent 自進(jìn)化過程與強(qiáng)化學(xué)習(xí)算法訓(xùn)練過程對(duì)齊,SEAGym 能夠?qū)㈧o態(tài)的 benchmark 通過 train batch 組織為自進(jìn)化過程中的某個(gè)任務(wù),并且利用 harbor 實(shí)現(xiàn)了對(duì)不同類型的 benchmark 的適配兼容,將復(fù)雜的 agent 自進(jìn)化過程統(tǒng)一用簡(jiǎn)潔清晰的超參數(shù)控制,為后續(xù)自進(jìn)化 agent 研究提供了統(tǒng)一的訓(xùn)練評(píng)測(cè)協(xié)議。
多視角評(píng)測(cè):不只問「有沒有變強(qiáng)」,還問「怎樣變強(qiáng)」
SEAGym 的關(guān)鍵設(shè)計(jì)是將傳統(tǒng)數(shù)據(jù) split 與評(píng)測(cè) view 區(qū)分開來。訓(xùn)練任務(wù)只用于產(chǎn)生更新證據(jù),評(píng)測(cè)視角則被拆分為多個(gè)部分:
Train batch:提供 Agent 更新所需的軌跡和反饋;
Update-validation:凍結(jié)中間 snapshot,觀察更新過程是否帶來階段性提升;
ID transfer:測(cè)試更新是否能遷移到同分布但未見過的任務(wù);
OOD transfer:測(cè)試更新是否能遷移到分布外任務(wù);
Replay:回放舊任務(wù),檢查是否出現(xiàn)遺忘或回歸;
Cost records:記錄 token、工具調(diào)用、運(yùn)行時(shí)間和更新成本。
這使得研究者可以看到自進(jìn)化過程中的細(xì)粒度動(dòng)態(tài)。例如,一個(gè) snapshot 可能在 validation 上提升,但在 OOD 上下降;一個(gè)中間版本可能短暫變強(qiáng),之后因?yàn)殄e(cuò)誤的 middleware 修改而崩潰;一個(gè)最終版本可能整體得分更高,但同時(shí)遺忘了一部分原本能解決的任務(wù)。
SEAGym 不只是輸出一個(gè) leaderboard 分?jǐn)?shù),而是保存每個(gè)階段的 snapshot、trajectory、public feedback、update summary、harness diff 和 metric records,用于后續(xù)診斷。
實(shí)驗(yàn)設(shè)置:Terminal-Bench 2.0 + HLE
論文在兩個(gè)互補(bǔ)任務(wù)源上實(shí)例化 SEAGym:
Terminal-Bench 2.0:偏 execution-heavy,包含命令行、軟件工程和環(huán)境交互任務(wù);
HLE:偏 reasoning-heavy,論文使用其中 text-only Math / Physics 作為 source task,并使用 CS/AI 與 Engineering 作為 OOD transfer task。
論文比較了 ACE、TF-GRPO 和 AHE三類自進(jìn)化方法,并進(jìn)一步做了 batch size、source diversity 和 cross-model transfer 等分析。
主要結(jié)果一:validation 提升不等于穩(wěn)定泛化
在主實(shí)驗(yàn)中,三種方法呈現(xiàn)出明顯不同的更新動(dòng)態(tài)。
AHE在 validation、ID 和 OOD 三個(gè)視角上都取得了提升:
validation:40.0 → 57.1,提升 17.1 個(gè)百分點(diǎn);
ID test:40.0 → 49.1,提升 9.1 個(gè)百分點(diǎn);
OOD test:22.5 → 28.8,提升 6.3 個(gè)百分點(diǎn)。
ACE的提升更溫和:
validation 提升 2.9 個(gè)百分點(diǎn);
ID 提升 3.6 個(gè)百分點(diǎn);
OOD 提升 2.5 個(gè)百分點(diǎn)。
TF-GRPO 則展現(xiàn)出另一種現(xiàn)象:它在 validation 上提升明顯,達(dá)到 +17.1 個(gè)百分點(diǎn),但 OOD 下降 2.5 個(gè)百分點(diǎn)。這說明 grouped rollout evidence 可以強(qiáng)化 source distribution 上的行為,卻不一定帶來穩(wěn)定的分布外遷移。
論文據(jù)此指出:只看 validation curve 很容易高估自進(jìn)化方法的真實(shí)泛化能力。
主要結(jié)果二:自進(jìn)化可能引入中間崩潰,final score 會(huì)掩蓋這一點(diǎn)
SEAGym 的 replay diagnostics 揭示了一個(gè)非常關(guān)鍵的現(xiàn)象:自進(jìn)化過程并不總是單調(diào)變好。
在 AHE的 train replay 實(shí)驗(yàn)中,初始 Agent 可以解決 34/80 個(gè)訓(xùn)練回放任務(wù),最終 Agent 可以解決 43/80 個(gè)任務(wù),看起來是一個(gè)正向提升。但如果觀察中間 snapshot,會(huì)發(fā)現(xiàn)第 4 個(gè) epoch 后 replay performance 一度跌到 6/80,并產(chǎn)生大量 rollout errors。
進(jìn)一步分析發(fā)現(xiàn),這不是普通意義上的 “模型忘記了怎么做題”,而是 harness evolution 修改了 middleware /runtime contract,導(dǎo)致 message construction 出現(xiàn)系統(tǒng)性錯(cuò)誤。之后的更新修復(fù)了該路徑,性能又恢復(fù)上來。
這說明,對(duì)于 self-evolving Agent,遺忘和退化不一定表現(xiàn)為知識(shí)能力下降,也可能表現(xiàn)為:
工具調(diào)用路徑被破壞;
middleware contract 被破壞;
completion protocol 被錯(cuò)誤修改;
validation 或 artifact 檢查邏輯變得過度約束;
runtime 行為發(fā)生系統(tǒng)性回歸。
如果只報(bào)告初始分?jǐn)?shù)和最終分?jǐn)?shù),這種中間崩潰完全不可見。而 SEAGym 通過 snapshot-level replay 和 task-level churn,將這類過程風(fēng)險(xiǎn)暴露出來。
主要結(jié)果三:batch size 影響 harness 更新穩(wěn)定性,且不是越大越好
論文進(jìn)一步研究了 AHE在不同 batch size 下的表現(xiàn):10、20、40、80。
結(jié)果呈現(xiàn)明顯的非單調(diào)關(guān)系:
batch 10:validation 從 37.1 降到 22.9,ID 從 38.2 降到 23.6;
batch 20:validation 從 40.0 升到 57.1,ID 從 40.0 升到 49.1;
batch 40:validation 從 37.1 升到 40.0,ID 從 41.8 升到 43.6;
batch 80:validation 從 42.9 降到 25.7,ID 從 41.8 降到 25.5。
這說明,對(duì)于 harness-level evolution,batch size 不是簡(jiǎn)單的統(tǒng)計(jì)效率問題。batch 太小會(huì)導(dǎo)致更新證據(jù)不足、更新頻率過高,從而增加 runtime regression 的機(jī)會(huì);batch 太大則會(huì)讓單次更新需要分析過多軌跡,稀釋每個(gè)任務(wù)的注意力,誘發(fā)粗糙或脆弱的 harness 修改。
在該實(shí)驗(yàn)中,batch 20 是 evidence diversity、per-task analysis depth、update frequency 和 harness stability 之間較平衡的設(shè)置。
主要結(jié)果四:訓(xùn)練來源多樣性影響恢復(fù)能力
論文比較了 mixed-source training 和 HLE-only training。
mixed-source 設(shè)置使用 Terminal-Bench + HLE,而 HLE-only 只使用 HLEMath/Physics。結(jié)果顯示,HLE-only run 在中間 snapshot 上也能取得有用提升,但最終 snapshot 出現(xiàn) collapse:
HLE-only final validation、ID、OOD 均降到 0;
但其 best intermediate snapshot 仍能達(dá)到 ID +7.3、OOD +3.8 的提升。
論文認(rèn)為,單一 benchmark 可能會(huì)把 harness 推向 benchmark-specific local optimum。相比之下,Terminal-Bench 提供了工具、環(huán)境、執(zhí)行路徑和 runtime 錯(cuò)誤方面的多樣信號(hào),HLE提供 reasoning-heavy 信號(hào),兩者結(jié)合可以幫助后續(xù)更新從壞狀態(tài)中恢復(fù)。
主要結(jié)果五:
harness 更新具有 backend 依賴
論文還考察了 cross-model transfer:用 DeepSeek、GLM 和 GPT-5.4 分別訓(xùn)練 AHEharness,再交換到不同 rollout model 上評(píng)估。
結(jié)果顯示,同 backend transfer 通常更穩(wěn)定:
DeepSeek-evolved harness 在 DeepSeek 上 ID +9.1;
GLM-evolved harness 在 GLM 上 ID +3.6;
GPT-5.4-evolved harness 在 GPT-5.4 上 ID +5.5。
但 cross-backend transfer 明顯不對(duì)稱。例如:
DeepSeek-evolved harness 能讓 GLM ID +7.3,但讓 GPT-5.4 ID -3.6;
GPT-5.4-evolved harness 能讓 GPT-5.4 ID +5.5,但讓 GLM ID -7.3;
OOD 結(jié)果更不穩(wěn)定,多個(gè) cross-backend OOD gain 為 0 或負(fù)數(shù)。
這說明 harness 更新并不是完全模型無關(guān)的。不同模型在 rollout 中暴露出的 failure surface 不同:有的更容易暴露工具恢復(fù)問題,有的更偏向文本推理失敗,有的更強(qiáng)調(diào) artifact constraints 和 validation sufficiency。因此,一個(gè) backend 上學(xué)到的 harness 修改,不一定適合另一個(gè) backend。
這篇工作的意義
自進(jìn)化目前已成為大家押注的下一代技術(shù)范式遷移的主流方向,SEAGym 從更本質(zhì)的智能體環(huán)境構(gòu)建的角度出發(fā),將自進(jìn)化過程建模為清晰的強(qiáng)化學(xué)習(xí)過程,提出了評(píng)測(cè)自進(jìn)化 Agent 的統(tǒng)一系統(tǒng)框架和協(xié)議。SEAGym 不再只關(guān)注智能體任務(wù)完成的結(jié)果,而是從過程出發(fā)去研究智能體的進(jìn)化機(jī)制和規(guī)律。
它將研究問題從「最終 Agent 的成功率是多少?」推進(jìn)到:不同自進(jìn)化機(jī)制到底更新了 Agent 的哪個(gè)部分?是否存在 OOD 泛化?是否遺忘了舊能力?性能提升是否伴隨更高成本?
隨著 Agent 被用于軟件工程、數(shù)據(jù)分析、科研自動(dòng)化、網(wǎng)頁(yè)操作和長(zhǎng)期任務(wù)執(zhí)行,這類問題會(huì)越來越重要。一個(gè)能夠持續(xù)修改自身工具、memory 和 middleware 的 Agent,如果沒有過程級(jí)評(píng)測(cè),很可能在某些任務(wù)上表現(xiàn)更強(qiáng),同時(shí)在另一些任務(wù)上悄悄引入不可見的風(fēng)險(xiǎn)。
SEAGym 的價(jià)值就在于,它讓這些風(fēng)險(xiǎn)變得可觀測(cè)、可回放、可診斷。
未來方向
論文也指出,當(dāng)前 SEAGym 的實(shí)驗(yàn)主要集中在 Terminal-Bench 2.0 和 HLE兩類任務(wù)源上,覆蓋了 execution-heavy 和 reasoning-heavy 場(chǎng)景,但還沒有擴(kuò)展到 web interaction、desktop interaction、long-horizon software engineering、data-analysis workflows、多智能體協(xié)作和 continuous online task streams 等更復(fù)雜場(chǎng)景。
此外,SEAGym 的多視角評(píng)測(cè)帶來了明顯的 cost /coverage tradeoff。保存多個(gè) snapshot,并在 validation、ID、OOD、replay 等視角上重復(fù)評(píng)測(cè),會(huì)消耗大量 token 和時(shí)間。未來需要研究更高效的 snapshot selection、adaptive replay 和 budget-aware evaluation。
總體來看,SEAGym 為自進(jìn)化 LLM Agent 提供了一套更細(xì)粒度的評(píng)測(cè)語言:它不再把 Agent 視為一個(gè)固定模型,而是把其 prompt、memory、tools、middleware 和 runtime state 共同構(gòu)成的 harness 視為會(huì)隨經(jīng)驗(yàn)變化的對(duì)象。對(duì)于理解下一代長(zhǎng)期運(yùn)行 Agent 的可靠性、可遷移性和安全性,這是一項(xiàng)基礎(chǔ)設(shè)施式的工作。
團(tuán)隊(duì)介紹
SEAGym 由清華大學(xué)自動(dòng)化系團(tuán)隊(duì)提出,作者包括 Congjie Zheng、Chuanyi Xue、Bin Liang、Jun Yang 和 Changshui Zhang。
其中,Congjie Zheng 與 Chuanyi Xue 為共同第 一作者,Jun Yang 與 Changshui Zhang 為通訊作者。
團(tuán)隊(duì)長(zhǎng)期關(guān)注大模型智能體、agent harness、自進(jìn)化機(jī)制和智能體評(píng)測(cè)基礎(chǔ)設(shè)施等方向。
用法治力量護(hù)佑漁船安全——《河北省漁業(yè)船舶管理?xiàng)l例》解讀 9月1日12時(shí),為期4個(gè)月的黃渤海休漁期正式結(jié)束,河北省沿海地區(qū)的海洋
常山北明:截止2023年9月8日,公司股東總戶數(shù)為210,474戶 常山北明(000158)09月12日在投資者關(guān)系平臺(tái)上答復(fù)了投資者關(guān)心的問題。
“最難”畢業(yè)季 全國(guó)人大代表胡成中“辨癥”大學(xué)生就業(yè)難 近年來,由于高校畢業(yè)生規(guī)模持續(xù)攀升,每年畢業(yè)季都被網(wǎng)友冠以“史
驗(yàn)光不是“測(cè)度數(shù)”,而是視覺系統(tǒng)的精密測(cè)繪 很多家長(zhǎng)帶孩子進(jìn)店,第一句話是:“快幫我孩子查個(gè)度數(shù),配副眼鏡
2026年成都旅行社怎么選?這份靠譜清單請(qǐng)收好 朋友們,最近是不是刷到不少“99元游九寨溝”、“200元包吃住玩三天
站臺(tái)門電源市場(chǎng)格局深度解析:寡頭效應(yīng)顯著,國(guó)內(nèi)外賽道分化加劇 軌道交通作為國(guó)家基礎(chǔ)設(shè)施建設(shè)的核心板塊,其產(chǎn)業(yè)鏈的每一個(gè)細(xì)分領(lǐng)
離婚協(xié)議必須要公證書嗎 離婚協(xié)議不是必須要公證書,經(jīng)過離婚登記后離婚協(xié)議即可生效,如果沒有