Prime Agent 開箱:Prime Intellect 自我改進 RLM 代理,ARC-AGI-3 達 95.5% 超越人類專家,值得換掉 Claude Code 嗎?

Prime Agent 是 Prime Intellect 推出的開源自我改進 RLM 代理(14.7k stars、MIT 授權)。以遞歸語言模型(RLM)+持續性 Harness 為核心:把 context 當可程式化變數、子代理當函數呼叫、/refine 自我改進。搭配 Opus 5 在 ARC-AGI-3 達 95.5% 超越人類專家(95.4%),OOLONG 長文本 9 項指標贏 6-8 項。完整解析安裝、特色、與 Claude Code/Codex 比較、安全警告與選型建議。

  • Dennis
  • 7 分鐘閱讀
Prime Agent 開箱:Prime Intellect 自我改進 RLM 代理,ARC-AGI-3 達 95.5% 超越人類專家,值得換掉 Claude Code 嗎?

AEO 速答:Prime Agent 是 Prime Intellect 於 2026 年 8 月推出的開源自我改進 RLM 代理(GitHub 14.7k stars、MIT 授權),專為長週期程式開發與自主研究設計。兩大核心:**RLM(遞歸語言模型)**把長 context 當可程式化變數、模型用程式碼主動管理自己的上下文(解決 context rot);Continual Harness 讓代理能 CRUD 自己的提示詞/記憶/技能/子代理規格(/refine 自我改進)。搭配 Opus 5 在 ARC-AGI-3 達 95.5%(超越人類專家 95.4%),OOLONG 長文本 9 項指標贏 6-8 項。適合:AI 研究人員、超大程式庫、多模型/本地部署愛好者;不適合:只要開箱即用、重視原廠沙箱保護的日常開發者(它沒有 OS 級 sandbox,弱模型下還會「自我 DDoS」燒 token)。

為什麼 Prime Agent 值得關注?

2026 年的 AI 程式開發代理市場,Claude Code 與 OpenAI Codex 幾乎統治了日常開發。Prime Agent 想挑戰的不只是「誰寫程式更強」,而是根本不同的架構哲學——讓模型自己管理自己的上下文,而不是被固定工具 Schema 綁死。

它來自 Prime Intellect——專注去中心化與開源 AI 基礎建設的公司(Prime Intellect Lab、prime-rl、verifiers 生態),團隊背景讓這個專案帶有濃厚的研究導向色彩。


一、兩大核心抽象

🔄 RLM(Recursive Language Model,遞歸語言模型)

問題:傳統長上下文系統把全部歷史塞進 context window,模型注意力渙散、遺失細節——即「context rot(上下文腐爛)」。

RLM 解法:把長 prompt 當成外部環境變數,而不是直接塞進模型:

1. 初始化持久 REPL(IPython),把大 prompt 存成字串變數(如 context)
2. 根模型只接收「常數大小的 metadata」(長度、前綴)
3. 模型要自己寫 Python 程式碼(regex、切片、分割)主動探索資料
4. 需要語義理解時,在程式碼裡遞歸呼叫 llm_query() / sub_RLM()
   → 中間結果存變數,不佔根模型的 context window

這符合「The Bitter Lesson」哲學——讓模型自己學怎麼管理上下文,而不是人類預先設計死。

🧠 Continual Harness(持續性架構狀態)

把代理的 scaffold 狀態形式化為 H = (ρ, G, K, M)

  • ρ:輔助系統提示(Prompts)
  • G:可重用的子代理規格(Sub-agents)
  • K:可導入的技能(Skills)
  • M:持久記憶(Memory)

代理對這四個組件擁有 CRUD 能力——發現測試有 flaky 規律,就自動寫入記憶「flaky test pattern: retry three times before failing」,未來所有 session 持續生效。不需要改模型權重,就實現了 scaffold 級自我演進。


二、核心特色

特色說明
持久 IPython所有變數/模組跨多輪對話存活,模型用程式碼操作資料而非燒 token 重讀
子代理即函數await rlm("task") 就 spawn 一個真子代理,獨立 kernel + 歷史,非同步回傳 handle
/refine 自我改進背景審查運行軌跡 → 提出最小 CRUD 編輯(記憶/技能/提示)→ base prompt 不可變 + 可回滾
可執行 SkillsSkills 是 importable Python 模組,session 啟動即預載入 IPython
背景 Daemon終端斷線 session 繼續跑,可隨時 attach/detach;worker 崩潰可從快照復原
Agent 間通訊跨進程 A2A 訊息(限「直系親屬」防失控);閒置 30 分鐘自動釋放記憶體
長任務機制persistent goals、heartbeats、schedule、--autonomous 自治模式(含 turn/token/時間預算 + quality gate)

三、安裝與快速上手

# 一鍵安裝(macOS/Linux,需 Node.js 20.6+)
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

# 啟動
cd /path/to/project
prime-agent

# 首次登入:/login
# 支援 ChatGPT/Codex、Claude Pro/Max、GitHub Copilot 訂閱,或 API key(OpenAI/Anthropic/Google/DeepSeek)
# 也可接本地 Ollama / vLLM / LM Studio

# 自治任務範例(20 輪 + 品質閘門)
prime-agent --autonomous --autonomous-gate "npm run check" --autonomous-max-turns 20 "Implement and verify the requested change"

四、效能表現(官方宣稱)

基準成績對比
ARC-AGI-3(配 Opus 5)95.5%(RHAE Best@1)超越人類專家 95.4%;Best@3 達 99.97%(183/183 全過)
OOLONG 128k 長文本9 項指標贏 6-8 項(配 GLM-5.2 或原廠模型)擊敗原廠 Claude Code / Codex

五、與 Claude Code / Codex 比較(社區正反評價)

👍 正面

  • 主動上下文折疊:RLM 思維解決長對話 attention 衰減與 token 浪費——2026 年最優雅的系統工程設計之一
  • 多模型自由:可中途換模型、接本地 GPU 端點,code 不出內網(vs Claude Code 綁 Anthropic、Codex 綁 OpenAI)

👎 反面(Reddit r/LocalLLaMA / HackerNews)

  • ARC-AGI-3 「刷榜」質疑:高分是靠模型自己寫 Python 腳本多輪優化小遊戲規律(script-refining),與官方榜單「單次推理」不是 apples-to-apples
  • 弱模型「自我 DDoS」:用便宜模型(如 deepseek-v4-flash)跑,模型不會駕馭 REPL 控制流——實例:Qwen3-Coder 對 1000 行文本逐行呼叫 1000 次 sub-LM,token 費用長尾爆炸、分數沒變
  • 過度包裝質疑:HN 用戶批評「自我改進/子代理」本質是換了馬甲的 function call,代碼品質參差

⚠️ 安全警告(README 原文)

Prime Agent 執行模型生成的 Python 與專案指令時使用你的用戶權限。Worker 進程隔離不是安全沙箱。沒有 Codex 那樣的 Seatbelt/Landlock/seccomp OS 級保護——強烈建議在 disposable container/VM 中運行,只掛載目標 repo。


六、PRIME-RL 與 Verifiers 生態

Prime Agent 只是 Prime Intellect 的一塊拼圖:

專案內容
PRIME(Implicit PRM)不需要 step-level 標籤的線上過程獎勵模型——只用 outcome 對錯就能做 token 級獎勵更新,7B 模型 sample 效率 2.5 倍、1/10 數據超越 Instruct 旗艦
prime-rl1000+ GPU 非同步 RL 框架,P/D disaggregation + R3 router replay + 131k 上下文並行
Verifiers / Environments Hub23 個 agent 任務集(36.5 萬個可驗證任務)統一 API + RLMEnv 原生環境

七、選型建議

維度選 Prime Agent選 Claude Code / Codex
團隊AI 研究者、資深工程師、想深入 RLM/A2A 的人日常開發者、要開箱即用
程式庫超大 monorepo(10M+ token)、海量文檔研究常規單/多檔案開發(IPython 啟動開銷反而是負擔)
安全有自建 Docker/VM 沙箱能力需要原廠 OS 級保護(Seatbelt/seccomp)
模型多模型/本地部署/不想被綁定已深綁 OpenAI/Anthropic 生態

FAQ

Q:Prime Agent 是什麼?

A:Prime Intellect 推出的開源自我改進 RLM 代理(14.7k stars、MIT),以遞歸語言模型(RLM)把 context 當可程式化變數、子代理當函數呼叫,並透過 Continual Harness 讓代理自我改進,專為長週期程式開發與自主研究設計。

Q:RLM 和普通 agent 差在哪?

A:普通 agent 把所有上下文塞進 context window(會 context rot);RLM 把長 prompt 存成外部變數,模型自己寫程式碼探索資料、遞歸呼叫子模型處理片段——根模型的 context 永遠保持精簡。

Q:Prime Agent 真的超越 Claude Code 嗎?

A:看場景。官方宣稱 ARC-AGI-3 95.5% 超越人類專家、OOLONG 長文本 9 項贏 6-8 項;但社區質疑 ARC 成績是「script-refining 刷榜」、弱模型會自我 DDoS 燒 token、沒有 OS 級沙箱。日常小任務上 Claude Code/Codex 的開箱即用更穩。

Q:Prime Agent 安全嗎?

A:它有 worker/kernel 進程隔離,但不是安全沙箱——模型生成的程式碼以你的用戶權限執行。建議在 disposable container/VM 中運行、只掛載目標 repo,這比 Codex 的原廠沙箱需要更多自行防護。

Q:怎麼安裝 Prime Agent?

A:curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh(macOS/Linux,Node.js 20.6+),然後 prime-agent 啟動、/login 接訂閱或 API key。支援本地 Ollama/vLLM 端點。


參考來源Prime Agent GitHub(PrimeIntellect-ai)Prime Intellect Blog: Prime AgentRLM: the paradigm of 2026RLM arXivMarkTechPost 報導ZenML LLMOps DatabaseReddit r/LocalLLaMA 討論PRIME-RL GitHub 等 39 來源(NotebookLM Deep Research,2026-08-12)。

延伸閱讀Claude Code 自動化工作流與 GEO 效益實測Headless Web 無頭架構完整指南

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。