介紹一項創新技術「自我工具箱(Self-Harness)」,讓 AI 代理能自行修正其運作環境「工具箱」,從而將效能最高提升 60%。
試想一下,當您在工作中犯錯時,通常會詢問周遭的人或翻閱手冊來修正。但如果能夠自行分析犯錯原因,並為了避免下次再犯,直接修正自己的工作方式(規則),那會是什麼樣的情景?最近,人工智慧(AI)領域正發生這種事,這都要歸功於一項名為「自我工具箱(Self-Harness)」的有趣技術。
這為何重要?
我們過去使用的 AI 服務大多在固定的規則下運作,只在開發者預先設好的框架(Scaffolding,一種工作指南)內進行判斷與行動。如果 AI 給出錯誤答案或無法妥善完成特定任務,必須由人類親自查看程式碼並進行修正。
然而,「自我工具箱」截然不同。這項技術使 AI 代理(代為執行使用者目標的智慧型軟體)能夠在沒有人類協助的情況下,自行修正其「運作環境」。簡單來說,就是 AI 能自行找出不足之處,並領悟變得更聰明的方法。這代表 AI 開發效率將大幅提升,且 AI 能自行解決人類尚未發現的細部優化問題。
輕鬆理解:整理 AI 的「工具箱」
「工具箱(Harness)」顧名思義,指的是代理工作時所需的設備或框架,就像木匠裝工具的箱子一樣。若以自我工具箱為例,就像是命令一個因為工具箱凌亂而經常掉落物品的木匠(AI 代理),讓其自行整理工具箱,並將所需工具移至更方便拿取的位置。
具體而言,AI 會經歷以下過程:
- 失敗分析:代理在執行任務失敗後,會彙整紀錄並分析「失敗原因」的規律。出處:Self-Harness: Harnesses That Improve Themselves
- 修正建議:為彌補發現的弱點,AI 會自行提出修改建議,調整最基礎的程式碼或系統提示詞(給 AI 的指令)。出處:How self-improving harnesses are rewriting the agent engineering playbook
- 應用與驗證:在修正後的規則下重新開始工作,並確認效能是否確實提升。出處:Researchers introduce Self-Harness
如同上述,自我工具箱是一種無需外部強制更新、在代理內部自動完成的「自我改善」循環。
現況:變得多聰明了?
實際在實驗室中的成果如何呢?研究團隊將自我工具箱技術應用於僅具備基礎功能(系統提示詞與檔案讀寫工具)的 AI 代理上,結果令人驚豔。儘管幾乎沒有人類參與,AI 卻能自行優化其運作規則並執行任務。
從數據看更是明確。與現有方式相比,應用自我工具箱的 AI 代理效能提升了 15% 至最高 52%,在特定狀況下,任務成功率更報告提升高達 60%。出處:What Is Self-Harness?, 出處:Researchers introduce Self-Harness
未來展望
當自我工具箱技術普及後,AI 代理與我們的工作方式將產生巨大改變。目前的 AI 往往需要使用者從頭到尾詳盡地設定指令,但未來只要說一句「請完成這個專案」,AI 便能在執行過程中透過無數次的試錯自行修正,像資深員工一樣成長。
當然,在 AI 自行修改程式碼的過程中,也需要同步討論「平台級別的安全機制」,以防止發生預料之外的問題。出處:DeepSeekHarness: An Open-Source Agent Execution Layer AI 已經超越了單純的「答題機器」,正邁向自行設計並發展自身智慧的時代。
參考資料
- Self-Harness: Harnesses That Improve Themselves
- [2606.09498] Self-Harness: Harnesses That Improve Themselves
-
[What Is Self-Harness? Complete Guide to AI Agents That Improve Themselves (2026) explainx.ai Blog](https://explainx.ai/blog/what-is-self-harness-ai-agents-complete-guide-2026) -
[Researchers introduce Self-Harness, a framework that lets AI agents rewrite their own rules, boosting performance up to 60% VentureBeat](https://venturebeat.com/orchestration/researchers-introduce-self-harness-a-framework-that-lets-ai-agents-rewrite-their-own-rules-boosting-performance-up-to-60) - How self-improving harnesses are rewriting the agent engineering playbook - TechTalks
- DeepSeekHarness: An Open-Source Agent Execution Layer That
- 無須人類工程師,自行修正運作環境
- 直接修改 AI 模型本身的權重
- 必須時常經過人類審核
- 匯整失敗紀錄以找出規律
- 隨機重新執行所有嘗試
- 透過電子郵件向人類開發者報告
- 最高 10%
- 最高 60%
- 效能無明顯提升