你每一次搜尋、瀏覽網站,或打開 App 與服務互動,都在產生數據。
這些數據對 AI 公司的價值以「數十億美元」計,但現在幾乎所有利益都落在掌握平台的一方。
新一代的去中心化 AI 數據市集想把這套權力結構翻轉過來:利用加密貨幣,只要你的數據被用來訓練機器學習模型,就直接付錢給你。
這不只是「擁有你的數據」這麼簡單的口號。
背後有嚴謹的驗證層、staking 抵押系統、隱私保護機制與代幣經濟學,決定了貢獻者到底能不能拿到合理報酬,甚至會不會一毛都拿不到。
下面我們從基礎架構開始,拆開這些系統是怎麼運作的。
快速重點整理
- 去中心化 AI 數據市集,把握有原始數據的人,直接與需要標註、驗證訓練資料的 AI 開發者連上線,並用加密代幣作為無須信任中介的支付管道。
- 貢獻者提交數據後,會先在鏈上或透過去中心化預言機網路驗證通過,智能合約才會撥款,中間不再有抽成的平台方。
- 聯邦學習、零知識證明等隱私技術,讓數據可以變現,但原始敏感資料不必離開貢獻者的裝置。
- 以抵押(staking)、懲罰機制(slashing)、聲譽評分為核心的代幣經濟,讓貢獻者有誘因提供高品質數據,而不是垃圾內容。
- 建構在 Solana 上的 Kled AI 等專案是目前前沿案例,但這個模式其實跨多條公鏈與不同架構在競爭。
為何 AI 公司這麼「吃數據」,現在又是誰在買單?
大型語言模型、影像辨識系統對數據的渴求,很難被誇大。
一次前沿模型的訓練,就可能吃掉數百億個文字 token、數百萬張已標註影像,或是以「年」為單位的人類行為紀錄訊號。
這些數據總要有來源。
目前主流來源大致有幾條路:
大規模網路爬蟲負責收集公開文字內容;平台授權合作則讓 AI 實驗室能取得專有資料集——像 Reddit、新聞出版集團、圖庫業者都已簽過這類合約。
另外,群眾外包標註平台,則以微薄工資請人幫忙標註影像、轉錄語音、或評分 AI 回答品質。
標註市場的規模不小,卻相當「剝削」。集中式平台上的標註員,一小時往往只拿到 1 至 5 美元,但他們生產的標註資料集,轉手賣給 AI 開發者時,單筆價格往往是原本的數十倍甚至百倍。
問題出在結構。站在數據擁有者和 AI 購買方中間的集中式平台,吃走了大多數利潤:它們訂價、制定品質標準,還能單方面把貢獻者封殺,卻沒有真正申訴管道。
去中心化市集就是要把這個中介層,換成智能合約、開放協議與代幣支付網路。
延伸閱讀: USDT Briefly Dethrones Ethereum As Crypto’s No. 2 Asset
什麼叫「去中心化 AI 數據市集」?
本質上,去中心化 AI 數據市集是一套協議,讓數據供給方與需求方在沒有中心仲介的情況下對接。
買方通常是 AI 開發團隊或研究單位,在鏈上發布「數據需求單」,清楚寫明需要什麼類型的數據、品質標準、格式要求,以及每筆通過驗證的資料願意付多少錢。
賣方則是個別貢獻者,或將多方資料打包的聚合方,來承接這些需求。
智能合約扮演的是「第三方保管」的角色。
買方發布需求時,先把預算鎖進合約。當有貢獻者提交的數據通過驗證程序,合約才會自動撥款。
雙方不需要互信,只需要相信寫死在合約裡的規則。
數據本身通常不會直接存上鏈。
把幾 GB 的標註影像硬塞進 Ethereum (ETH) 或 Solana (SOL) 成本高到不可行。
實務上,資料會存放在像 IPFS 或 Arweave 這類去中心化儲存網路,上鏈的只是一段「內容雜湊值」——也就是檔案的唯一指紋。
智能合約會檢查貢獻者提交的雜湊,確認它對應的檔案是事先驗證過、未被竄改的版本,才會開啟撥款。
內容雜湊是一小串由檔案內容「數學運算」得出的字元。只要檔案內容改動一個位元,雜湊值就會完全不同。這讓人幾乎不可能事後改檔、重複拿舊資料來騙取報酬。
延伸閱讀: Techdollar Raises $3M To Let Startup Workers Cash In Without Selling
沒有中心審核員,數據要怎麼驗證?
驗證其實是整個設計中最難的問題。集中式平台可以直接請專職人員審稿。
但智能合約無法「看」圖片,或判斷一段文字標註是不是正確;它只能執行邏輯。去中心化市集通常用三種方法(而且常常是混搭)來解這題。
密碼學證明 適用於有明確結構、可以用數學方式檢查正確性的數據。假設貢獻的是 GPS 軌跡、感測器讀數或金融紀錄,零知識證明就能在不洩漏原始數值的前提下,證明這些數據「確實在某時間被記錄」、「落在合理區間」、「來自特定裝置」等條件。
群眾驗證 則用在帶主觀判斷的標註任務。市集會安排多位獨立貢獻者針對同一筆資料給出標註,合約再比對這些答案,讓與多數結果一致的人拿到報酬,系統性偏離的人則會被扣分或處罰。這有點像集中式平台常見的多重標註機制,但驗證流程本身去中心化。
抵押與懲罰(staking / slashing) 則在經濟層面綁住行為。貢獻者要先鎖住一筆平台原生代幣,才能開始提交數據。如果他的資料一再被驗證層判定為錯誤或疑似造假,就會被「slashing」,也就是部分甚至全部沒收抵押金。這讓隨便亂丟垃圾數據變得昂貴,迫使貢獻者和買方的品質要求站在同一陣線。
延伸閱讀: XRP Tests $1 Support As $0.60 Crash Risk Deepens
隱私如何被保護?兩大關鍵技術
這個模式最顯而易見的張力就是隱私:如果用戶把自己的瀏覽紀錄、健康數據賣給 AI 開發者,價值的確存在,但暴露風險也很真實。去中心化數據市集目前主要靠兩個已逐漸成熟的技術來處理。
聯邦學習(Federated Learning) 讓原始資料完全留在貢獻者裝置上。不是把數據送到中央伺服器,而是把 AI 模型送到用戶那端,在本地資料上進行訓練;訓練完成後,只把更新後的「模型權重」——一堆無法直接還原原始資料的數學參數——傳回開發者。眾多用戶的權重更新會被聚合,形成更強的模型,整個過程中訓練數據從未離開用戶環境。
差分隱私(Differential Privacy) 則是在資料分享前,刻意加入經過計算的「統計噪音」,讓任何人幾乎不可能從整體資料集中,反推出某個人的具體紀錄,同時又保留訓練模型需要的重要統計結構。噪音可以調整:噪音越大,隱私越強,但資料的精準度也會略為下降。
這些技術在監管上也很關鍵。歐盟 GDPR、美國加州消費者隱私法等法規,對個資跨境傳輸與用途有嚴格規範。一個能可信主張「系統流程從不傳輸原始個人資料」的數據市集,在合規路徑上會比單純販售原始資料的模式乾淨得多。
延伸閱讀: HIVE Just Borrowed $115M At Zero Percent To Bet Against Bitcoin Mining
代幣經濟、抵押機制,以及貢獻者實際怎麼拿錢?
各平台的付費設計不同,但多數會使用自家原生功能型代幣,而不是直接用 Bitcoin (BTC) 這類主流資產結算。這枚代幣通常同時扮演數個角色:
第一,它是市集裡發佈數據需求的「計價單位」。買方會以平台代幣標價,這讓代幣能吸收需求面價值——需求單越多,願意鎖進系統的代幣量就越大。
第二,抵押機制會在供給端形成鎖倉。貢獻者必須持有並抵押代幣才能參與,既減少流通供給,也把他們的利益和整個網路健康程度綁在一起。
第三,聲譽往往跟代幣歷史綁定。一位長期抵押、不斷有資料被接受、從未被 slashing 的貢獻者,會在鏈上累積起可驗證紀錄。這樣的聲譽分數,讓他的數據有機會賣出溢價,因為買方會比起「沒有歷史的新人」更信任他。
實務上,資金流大致長這樣:假設一位買方發布需求時,先往合約裡存入 500 枚代幣。某個貢獻者提交了 50 筆已標註資料,經驗證層審核通過後,合約自動撥出 50 枚代幣給這位貢獻者、2 枚分給協助驗證的節點,剩下 448 枚繼續保留給後續貢獻者。買方在付款確認後,取得對這批已驗證資料的存取權。
前提仍然是:代幣經濟只在「真的有數據需求」時才成立。只靠發幣炒作、卻沒有實際 AI 開發方進場的專案,很快就會被市場淘汰。 在這類模式下,只有對貢獻者發放獎勵,卻缺乏真正願意付費採購資料的 AI 開發者作為「另一端買方」,等於不斷釋出代幣、卻沒有實質需求回收,最終只會形成難以為繼的通膨賣壓。
延伸閱讀:OpenAI 推遲兆元美元 IPO,市場震盪考驗 Altman 雄心
Kled AI 等專案如何在 Solana 上實作這套模式
在 Solana 上,Kled AI 被視為當前代表性案例之一。這套協議將自己定位為一個去中心化資料市集,讓個人可以針對 AI 訓練需求,把自身資料貨幣化。由於 Solana 手續費極低、吞吐量高,非常適合高頻、小額的微支付場景——例如為單張已標註圖片支付極小數量代幣,這在 Solana 上是可行的經濟模式,但在以太坊主網上則幾乎不具成本效益。
Solana 的架構在「速度」上同樣關鍵。只要資料驗證完成就要觸發付款,結算必須快速。若貢獻者每次都得等上幾小時才能看到款項入帳,多數人不會願意使用這種市集。Solana 具備亞秒級最終確認時間(sub‑second finality),整體支付體驗更接近傳統網路平台,同時又保留智慧合約的信任最小化特性。
近期與 Kled AI 一同受到關注的 Velvet 則採取另一種切入角度——它是基於鏈上的 AI 投資組合終端,整合現貨交易、永續合約與收益策略。它之所以與這個題材相關,在於同樣展現出共同主軸:AI 系統直接讀取鏈上資料運作,並透過加密貨幣結算。Kled AI 著重於打造「原始訓練資料」的市場,Velvet 則可視為消化這些經過處理之市場數據的 AI 應用,兩者分別位於同一條資料經濟供應鏈的兩端。
其他相關專案還包括率先在以太坊提出「資料代幣化資產」概念的 Ocean Protocol,以及透過獎勵機制,引導使用者貢獻閒置頻寬與瀏覽行為給 AI 訓練管線的 Grass。儘管各自的技術架構不盡相同,它們都圍繞同一核心模式:透過密碼學與智慧合約,對「經驗證的資料貢獻」進行自動化付款。
延伸閱讀:Anthropic「Mythos 凍結」為亞洲挑戰者 Sakana AI、360 打開缺口
誰真正受惠?風險又在哪裡?
對個別資料貢獻者而言,吸引力相當直觀:過去被科技平台「免費拿走」的價值,如今有機會直接變現。若某人擁有龐大社群影響力、特定領域專業知識,或可提供稀缺數據型別——例如醫療紀錄、專業法律文件、各種非英語內容——在一個具備真實 AI 開發需求的市場中,這類資料都能拿到相對可觀的溢價。
對 AI 開發者來說,去中心化市集則打開了傳統爬蟲與授權模式難以觸及的資料池。像是人工偏好回饋(preference data)、利基領域的標註內容,以及來自長期被忽視地區的多語系資料,都是相對稀缺的資產。能在規模上蒐集並驗證這些資料的協議,具備實質經濟價值。
但風險同樣明確,而且雙方都得面對。代幣價格波動意味著:今天拿到原生代幣的貢獻者,在真正打算花用時,可能發現其折算成法幣後的價值已大幅縮水;反過來,買方也可能遇到在預算規劃完成、正式執行資料採購前,代幣價格突然飆漲,導致實際取得資料的成本遠高於原先預期。
「資料品質」則是更棘手、且尚未被完全解決的課題。群眾驗證、質押機制等設計確實能抑制部分詐騙行為,但無法完全杜絕。熟練的惡意參與者可以花時間經營假聲譽,慢慢滲透系統;而 AI 開發者一旦從尚未建立口碑的新市集採購資料,相較於向擁有多年紀錄的既有標註服務商合作,必然得承擔更高的品質風險。
最大的未知數在於監理。個人資料貨幣化橫跨多重管制領域:資料隱私法、用於結算的代幣是否涉及證券監理,以及仍在成形中的 AI 治理架構。一個在某司法轄區「完全合規」運作的市場,到了另一個國家,可能瞬間落入法律灰色地帶。
延伸閱讀:以太幣失守關鍵支撐後,價格是否恐跌向 1,000 美元?
結語
去中心化 AI 資料市集,實際上是對一個真實且明確的經濟問題,提出具技術含量的具體解法:過去替 AI 模型產生訓練資料的人,幾乎拿不到任何回報。
透過智慧合約、內容位址儲存(content‑addressed storage)、聯邦式學習(federated learning)以及代幣質押等工具,有可能打造一套讓價值直接流向資料貢獻者的制度,而非再由中心化平台「吃掉中間利潤」。
這套模式仍處在早期階段。
代幣經濟設計還在摸索成熟路徑;驗證系統必須證明自己能在不被惡意遊戲的前提下,撐得住數百萬名貢獻者;圍繞個人資料貨幣化的監管框架也遠未定案。
但「需求端」並不會消失。
AI 開發者需要的,是更多、而且更多樣化的資料,這已非傳統集中式來源所能穩定供應的量級。
這樣的結構性缺口,正是去中心化資料市集長期投資敘事的底層支撐。

