六大AI模型實盤對決兩週:四家慘敗,誰才是真風險?

六大AI模型實盤對決兩週:四家慘敗,誰才是真風險?
AI Agent Tokens Fell 90% While 250,000 Agents Went To Work (Image: AI)

你隨便問十個幣圈老手「什麼是代理交易平台」,多半會聽到三種完全不同的東西。

有人指的是把語言模型丟上榜單,用真金白銀做實盤競賽的「AI競技場」;
有人指的是自動幫你在各大借貸市場搬磚穩定幣、你睡覺它掙利息的收益保險庫;
還有人說的是,任何人都能一鍵發幣、綁個聊天機器人就叫「代理」的發射台。

這本來就是三門截然不同、風險結構完全不一樣的生意,「代理(agent)」這個字, 被用來把所有差異一股腦兒全抹平。真正有用的比較標準,從來不是誰的宣傳年化最高, 而是:哪些表現可以被外部驗證?運行時,誰握著你資產的「鑰匙」?

延伸閱讀嚴肅的 DeFi 老手都懂、菜鳥總是忽略的預言機真相

沒人願意好好面對的「現實檢驗」

先看這個類別裡被引用最多的實驗。Nof1 旗下的 Alpha Arena,給六個前沿大模型 各自配了 1 萬美元真實資本,統一提示詞與數據源,直接在 Hyperliquid 上做加密永續合約實盤, 放手讓模型自己交易了將近兩週。

結果是:阿里巴巴的 Qwen3 Max 最終盈利 22.3%,DeepSeek Chat V3.1 上漲 4.89%。
其他全軍覆沒:Claude Sonnet 4.5 虧損 30.81%,Grok 4 虧 45.3%,Gemini 2.5 Pro 虧 56.71%,GPT-5 更是慘跌 62.66%。

排名背後的行為模式,比勝負本身更重要。六個模型勝率幾乎都擠在 25%~30% 之間, Gemini 一口氣下了 238 筆單,Claude 只做了 38 筆;手續費則狠狠吞噬了結果——就算 Qwen 打贏了局,光費用也付了 1,654 美元。Nof1 的 Jay Azhang 後來承認,這套實驗配置對模型並不友善, 用有限上下文窗口硬餵數字時間序列。

兩週只是不停重複的一條單一路徑,說不上能證明「長期實力」。但它清楚展示了: 模型之間的差距可以大到離譜,任何平台只拿一個代理近期收益當招牌,其實幾乎什麼都沒告訴你。

競技場越來越多,換來的是另一種取捨

這個「標杆角落」如今熱鬧得多。TradeRank 正在滾動辦賽,單季就讓 16 個前沿模型同台競爭; 第九季已於 9 月 12 日開跑,每個模型各管 1 萬美元,橫跨十大主流加密貨幣和 50 檔美股大盤股, 每一筆交易、每一條推理過程全部公開。

這樣的樣本,當然比兩週實盤健康太多。代價是:這裡用的是模擬資本,不需要承擔真實滑點, 更不用處理「流動性乾掉、無法出場」這類問題。Alpha Arena 的成績「更痛」,因為錢是真的; TradeRank 的覆蓋「更廣」,因為錢是假的。任何平台引用「競技場成績」時,應該先說清楚, 它指的是哪一種。

錢真正放在哪裡過夜?

這個賽道裡最坦誠的案例之一,其實是一個已經關掉的專案。GizaARMA 代理, 自動在 AaveMorphoCompoundMoonwell 之間調配穩定幣收益, 管理資產最高時做到約 485 萬美元。

2026 年 2 月,Giza 宣布退休 ARMA,給用戶一個月時間撤資;3 月 26 日正式關停,所有資金 全數退回錢包,0 退出費。它的接班代理,到了 6 月鏈上資金餘額也不過約 1.4 萬美元。

這故事一體兩面。一方面,這次下架算是「善終」,比市面上許多「消失術」專案負責得多; 另一方面,它也赤裸裸地說明:真實需求其實很薄。整個動輒談「百億級」敘事的賽道, 面向零售端最知名的代理,資產高峰還不到 500 萬美元。

真正拉開差距的那個問題

一旦你不再盯著收益曲線,託管模式就會成為決定性的座標軸。如今大部分面向散戶的代理, 名義上都採「非託管」結構:資金留在你的錢包或你自己的智慧帳戶裡,而不是平台資產負債表上。 Neyro、HyperAgent、Kora、Almanak、Polystrat 大致都採這套作法。

更細的分水嶺,是代理在執行時拿到的是什麼權限。
HyperAgent 使用的是「只可交易」的 API Key,無法提幣——最糟糕的情況只是瞎交易虧錢, 而不是錢被整錢包掏空。這跟把你整個 Token 授權給代理、給它廣泛操作權限,是本質差異。
Numerai 則完全是另一個物種:它本質上是家對機構資本的對沖基金,外加一個公開的模型競賽; 散戶貢獻的是模型,而不是把自己的錢交給代理交易。

真正該問的,不是「代理能做什麼」,而是「在它運轉時,被允許做到哪裡」。

幾乎沒人比較「代理在哪裡下單」

在所有對比裡,總有第四個維度被忽略,卻往往比選哪個模型 本身還關鍵:代理最終要在哪個場景執行交易,而那個場景決定了撮合速度,也決定了誰真正掌管資金。

中心化交易所給代理的,是記憶體級的撮合速度,不用等區塊確認,外加深度充足的訂單簿, 現貨、期貨、選擇權一站式搞定。代價是:資金必須放在交易所;在開始交易前,你得過一輪身分審核; 而同一把 API Key 究竟具備多少提幣權限,還會取決於它是怎麼簽發的

去中心化的場景則完全反過來。錢留在你自己的錢包裡,代理的授權可以精準限制到「只可下單、不可提幣」, 也不需要登入註冊,只要連錢包就能用。代價是:每一筆委託都得等鏈上確認——主流永續協議上, 單次提交大致落在 0.2 到 1.1 秒之間——而你的訂單流是公開的。

對於一天只交易一次的策略,這點延遲幾乎可以忽略;但對所有「反應價格變化」為核心的策略, 這差距就是全部勝負。這也是為什麼不少號稱「on-chain」的代理產品,真正運行時其實悄悄掛在中心化場景上。

Yellow 打造的 Yellow Pro,就是試圖把這個二選一題拆掉的其中一個方案。
它底層是一個使用 ERC‑7824 狀態通道的清算網路:參與者先把抵押品打進智慧合約,與對手方開通通道, 然後在鏈下來回交換負債更新,最後只把淨結算結果上鏈。

《The Block》曾以「每日處理數十億則鏈下訊息、吞吐量可比肩中心化交易所」來形容這套架構。

落在使用者體感上,Yellow 給出的說法是:
使用者用自己的錢包自託管資產;代理在你的子帳戶裡運行、沒有提幣權;
執行延遲低於 1 毫秒;透過單一連接器打通現貨與永續;
開戶只需連錢包或 Google 帳號,無須身分驗證。

連線代理的時間也被壓到 5 分鐘內,相比透過傳統交易所路線,先 KYC、再生成 API Key、 最後還要對接連線模組,流程大幅縮短。

這些產品數據目前都來自 Yellow 本人,而非第三方測試,這點也是本文對所有平台一視同仁的註腳: 狀態通道架構本身已有公開文件與外部報導;至於延遲、上手時間這些具體指標, 更務實的做法,是先用小額資金實測,再決定要不要讓代理管「真正重要的那一筆」。

代幣層,完全是另一場賭局

除了產品本身,還有一整塊純靠敘事交易的「代理代幣宇宙」。
曾引爆首輪代理狂潮的發射台 Virtuals Protocol,從 2025 年 1 月高點算起,價格大約腰斬九成; 日收入從約 102 萬美元,一路掉到 2026 年 4 月初的 500 美元以下。
FET 跌幅約 91%,整體「代理賽道代幣」的總市值,也從 2025 年底逾 100 億美元, 回落到如今大約 29.2 億美元。

但使用量走的是另一條線。鏈上日活代理數在 2026 年初已突破 25 萬,年增約 400%;
微軟估算,如今 80% 的《財富》500 強企業都已在運行各類代理。換句話說:
技術與使用率節節攀升的同時,相關代幣一路塌方。
持有「代理賽道代幣」,其實是押一顆代幣,而不是押「這項技術一定有用」。

該怎麼真正比較這些產品?

四個問題,大致可以篩掉市面上絕大多數方案:

  1. 它對你的資金握有哪些權限?尤其是——它能不能提幣?
  2. 是否有可驗證的記錄?是鏈上歷史、公開推演,還是只有截圖與宣傳 PPT?
  3. 它的成績跑了多久?有沒有穿越過真正糟糕的市場,而不是只在一段平靜行情裡「順水行舟」?
  4. 如果團隊哪天說走就走,你的錢會怎樣?ARMA 已經證明,這題有好答案,也有非常壞的答案。

這四點都不能告訴你「這個代理一定會賺錢」。
它們只能決定一件事:當事情開始失靈時,你究竟能不能搞清楚,發生了什麼事。

下一篇推薦為什麼零知識證明,可能成為加密世界最關鍵的技術

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位经验丰富的财经记者,在报道加密货币和区块链技术方面具有丰富经验。他曾为 Benzinga 和 Cointelegraph 等多家媒体撰稿,报道新兴趋势、监管环境等内容。你可以在 Twitter 上通过 @murtuza_merc 和在 Telegram 上通过 mmerchant001 找到他。 披露:Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
六大AI模型實盤對決兩週:四家慘敗,誰才是真風險? | Yellow