你每一次搜尋、瀏覽網頁、用手機 App,其實都在產生數據。
這些數據對 AI 公司而言價值以十億計,但真正分到手的大多是平台,貢獻數據的用戶幾乎分不到甚麼。
新一代去中心化 AI 數據市場,就想打破這個格局——用加密貨幣,當你的數據被用來訓練模型時,直接向你支付回報。
當中的設計,遠不止一句「擁有你的數據」咁簡單。
背後牽涉到多重驗證層、質押 (staking) 機制、私隱保護,以及整套代幣經濟學——最後決定你是「有糧出」,還是被免費「打工」。
以下由基礎開始,拆解整個系統點樣運作。
重點速覽
- 去中心化 AI 數據市場,把掌握原始數據的個人,直接連接到需要經標註、經驗證訓練數據的 AI 開發者,以加密代幣作無需信任的支付工具。
- 數據供應者提交數據後,會先經鏈上或去中心化預言機網絡驗證,通過後智能合約才會自動放款,從收益分配中移除傳統中介平台。
- 聯邦學習、零知識證明等保護私隱技術,容許數據在「原始資料不離開用戶裝置」的前提下,被用作變現。
- 透過質押、懲罰機制及聲譽評分等代幣經濟設計,系統誘因會傾向鼓勵提交高質素數據,而非垃圾資料。
- 例如部署於 Solana 的 Kled AI 等項目屬於現時前沿,但這套模式已橫跨多條公鏈,亦出現不同競爭架構。
為何 AI 公司要「食」咁多數據?誰為此埋單?
不論是大型語言模型,還是圖像識別系統,對數據的胃口之大往往難以想像。
一次頂級模型的訓練,就可能要消耗數千億個文字 token、數以百萬計已標註圖像,甚至以「年」計的人類行為軌跡。
這些數據總要有來源。
目前主要有幾條路:
- 大規模網絡爬蟲,蒐集公開可見的文字內容;
- 平台授權交易,讓 AI 實驗室取得專有數據集——例如 Reddit、新聞出版商、素材圖片庫等都簽過相關協議;
- 群眾外判標註平台,以微薄時薪請人標註圖片、轉錄錄音、為 AI 回覆評分。
標註市場規模龐大,但高度剝削。傳統中心化平台上的工人,每小時只賺 1 至 5 美元不等,但他們生產出來的標註數據集,轉賣給 AI 開發者時,每條紀錄的售價往往高出數十倍甚至更多。
問題在於結構性:夾在數據擁有人與 AI 買家之間的中心化平台,攫取了大部分利潤——由它決定價格、制定質素標準,甚至可以單方面「封殺」供應者,後者幾乎毫無申訴空間。去中心化數據市場則以智能合約、開放協議及代幣結算網絡,嘗試取代這道平台層。
甚麼是「去中心化 AI 數據市場」?
從本質看,去中心化 AI 數據市場是一套協議,讓數據供給與需求在無中心中介的情況下直接對接。
買方通常是 AI 開發團隊或研究機構,會在鏈上發出「數據需求」,列明所需數據類型、質素門檻、格式要求,以及每條經驗證紀錄願意支付的價格。
賣方則是個人數據貢獻者,或代收代整合數據的機構,負責按要求交貨。
中間的「信託帳戶」角色,由智能合約擔當。
買家在發出需求時,先將資金鎖入合約。供應者提交的數據通過驗證後,合約便會自動放款。
雙方毋須互信,只需信任合約程式碼。
真正的數據本身,一般不會上鏈。
把大量已標註圖片直接存放在 Ethereum (ETH) 或 Solana (SOL) 上,成本高得難以接受。
實際做法,是將數據放在 IPFS、Arweave 等去中心化儲存網絡,只把「內容雜湊值」記錄在鏈上——即檔案的獨一無二「指紋」。
智能合約只要核對供應者提交的雜湊值,與經驗證檔案是否一致兼未被竄改,確認無誤才會付款。
內容雜湊值是一串由檔案內容數學運算得出的短字串。只要檔案變動一個 byte,雜湊值就會完全不同。這令事後「改檔」或回收他人舊數據來冒領酬金,幾乎成為不可能。
延伸閱讀:Techdollar 融資 300 萬美元 助初創員工變現股權非要沽貨
沒有中心審核員 數據點樣驗證?
驗證是整個設計中最難的一環。中心化平台可以請專人做質檢。
智能合約本身既看不到圖片,也無能力判斷文字標註是否正確,只能執行邏輯。去中心化數據市場通常會混合使用三大路線解決這個問題。
密碼學證明:適用於可用數學方式驗證結構性數據。例如提交 GPS 行車軌跡、感測器數據或財務紀錄時,可以用零知識證明來確認:資料符合指定條件、於特定時間產生、落在合理數值範圍內、確實來自某裝置——但整個過程毋須公開原始數值。
群眾驗證:則用於主觀標註工作。多名互不相識的供應者會評估同一份數據,再把結果提交鏈上。合約會比較各人答案,向與「多數共識」一致者支付獎勵,長期偏離者則被扣分或懲罰。這其實是中心化平台常用的「重複標註」質檢技術的去中心化版本。
質押與懲罰機制:則在上述基礎上加一層經濟激勵。供應者要先鎖倉平台原生代幣,才可開始提交數據;若其提交屢次被群眾驗證層否決,甚至被判定為惡意欺詐,其質押代幣便會被「斬倉」,部分或全數沒收。提交劣質數據的成本因而大幅提高,誘因自然與買家要求的質素更為一致。
延伸閱讀:XRP 試守 1 美元關口 失守或現 0.60 美元深度回調風險
私隱如何在市場模式中被保障?
一個顯而易見的矛盾是:用戶如果把瀏覽紀錄或健康數據賣給 AI 開發者,價值固然可觀,但私隱風險同樣真實。去中心化數據市場主要倚賴兩項愈趨成熟的技術來拆彈。
聯邦學習:原始數據全程留在用戶裝置上。與其把數據送去中央伺服器,不如反過來把 AI 模型送到用戶端,在本機以原始數據作訓練;訓練後只把更新後的模型權重——一堆無法直接還原原始資料的數學參數——傳回開發者。多名用戶的權重更新再被聚合,生成更強模型,整個過程訓練數據從未離開用戶環境。
差分私隱:則在分享前,向數據加入經過精密設計的統計噪音,使任何單一個體紀錄難以被反推,同時保留用於模型訓練所需的整體統計特徵。噪音加得愈多,私隱保障愈強,但數據效用會略為下降,兩者可按場景調校。
這些技術亦關乎法規風險管理。歐洲 GDPR、美國加州《消費者私隱法》等,都對個人數據的傳輸和用途設有嚴格限制。一個能有說服力地證明「原始個人資料從不離開用戶端」的市場,比起單純兜售原始數據的平台,往往更容易走通監管程序。
延伸閱讀:HIVE 發行 1.15 億美元零息票據 押注 AI 轉型及瑞典礦場
代幣經濟、質押機制與實際出糧流程
各平台的支付設計略有不同,但大多以原生功能型代幣結算,而非直接支付 Bitcoin (BTC) 等主流資產。這枚代幣往往同時扮演多重角色:
首先,它是市場內的計價單位。買方以代幣標價其數據需求,愈多需求被發出,代幣在需求端的實際用途便愈大。
第二,質押要求會在供應端製造「鎖倉」。供應者需持有並質押一定數量代幣,方可參與市場,既減少流通供應,亦令其利益與整個網絡的健康綁定。
第三,聲譽常與代幣歷史掛鈎。一名長期有質押、提交紀錄多次被接納、從未被斬倉的供應者,會在鏈上累積一套可驗證的「信用紀錄」。這種聲譽分數可令其數據賣得更高價格,因為買家自然較信任有往績的人,而非毫無歷史的新地址。
具體出糧流程大致如下:買家發出需求,同時往合約託管帳戶存入,例如 500 枚代幣。某供應者提交了 50 條已標註紀錄,經驗證層審核通過後,合約自動發放 50 枚代幣予供應者、2 枚作獎勵支付給參與驗證的節點,其餘 448 枚則保留給之後其他供應者。買家在支付確認後,即可存取這批經驗證數據紀錄。
代幣經濟能否成立,關鍵在於背後是否存在真實數據需求。只靠發幣炒作、缺乏落地需求支撐的項目,就算早期價位被炒高,最終亦難逃泡沫破滅一途。 向數據貢獻者派息,卻欠缺真正以現金(或可持續需求)買入數據的 AI 開發者,等同只不斷「派代幣、不創造實質買盤」,最終只會在代幣經濟上製造通脹壓力,難以長期維持。
延伸閱讀:OpenAI Delays $1 Trillion IPO As Market Volatility Tests Altman's Ambitions
Kled AI 等項目如何在 Solana 上落地這種模式
在 Solana 上,Kled AI 算是現時較具代表性的項目之一。團隊將協議定位為一個去中心化數據市集,讓個人可以將自己的資料貨幣化,專門用於 AI 模型訓練。Solana 手續費低、吞吐量高,非常適合高頻、細額的微支付場景——例如為每張已標註圖片支付極小數量代幣,在 Solana 上具經濟可行性,但在 Ethereum 主網上就難以成立。
Solana 的架構亦關乎交易速度。觸發放款的數據驗證,必須快速結算;沒有人會接受在一個市集裏,交了數據之後還要苦等數小時才能確認收款。Solana 近乎即時(亞秒級)的最終確認時間,令整個支付體驗非常接近傳統互聯網平台,同時仍然保留智能合約的無需信任特性。
與 Kled AI 一同走紅的 Velvet 則採取另一種切入點,它是 AI 驅動的鏈上投資組合終端,整合了現貨交易、永續合約及收益策略。它與這個版塊的關聯,在於呈現出同一條主線:AI 系統直接使用鏈上數據運作,並透過加密代幣結算。Kled AI 是將「原始訓練數據」商品化,而 Velvet 則是消化這些數據後衍生出的市場資訊與策略的應用範例,兩者可視為同一數據經濟管線的兩端。
其他同場較有代表性的項目包括在 Ethereum 上率先提出「數據資產代幣化」概念的 Ocean Protocol,以及將閒置頻寬及瀏覽數據,直接轉化為 AI 訓練報酬的 Grass。它們在技術與架構上各有不同,但共同點都是圍繞「經加密驗證的數據貢獻,換取可追蹤、可結算的代幣支付」這一核心模式。
延伸閱讀:Anthropic’s Mythos Freeze Opens The Door For Asian Challengers Sakana AI And 360
誰真正受惠?潛在風險在哪裏?
對個人數據貢獻者而言,吸引力相當直接:過去被平台免費「抽水」的數據價值,如今可以自己收回一部分。擁有龐大社交媒體影響力、專業領域知識,或能接觸到稀缺數據(例如醫療紀錄、專業法律文件、非英語內容)的人,在一個存在真實 AI 開發者需求的市集裏,往往能獲得明顯溢價。
對 AI 開發者來說,去中心化數據市集則提供了傳統爬蟲或授權模式難以取得的數據類型。人類偏好回饋、冷門垂直領域標註、以及來自欠缺代表性地區的多語種內容,都是實際稀缺的資源。若有協議能在大規模情況下,可靠搜羅並驗證這些數據,其本身就具備實質經濟價值。
但風險亦相當具體,且雙方都要承擔。代幣價格波動意味著:今天以原生代幣收錢的數據貢獻者,到真正套現時,可能發現以美元計價的實際價值大幅縮水;而買方面臨相反風險:從計劃購買數據到真正執行期間,代幣價格可能急升,令實際採購成本遠高於原本預算。
數據質素在大規模情況下一樣是懸而未決的難題。群眾驗證、押注(staking)等機制,可以壓低欺詐行為,但無法完全杜絕。更老練的惡意參與者,有機會在長時間內慢慢經營出「看似正常」的聲譽,然後集體詐騙;而 AI 開發者若從一個全新、未經驗證的市集購買數據,相比向具多年紀錄的傳統標註供應商採購,就不得不承擔額外的質量風險。
監管風險則是最大變數。個人數據貨幣化,踩在多重監管交叉點上:一方面牽涉私隱與數據保護法規,另一方面關乎相關代幣是否觸及證券監管,再加上仍在成形中的 AI 監管框架。某個市集在一個司法管轄區內完全合規,到了另一個地區,隨時變成模糊灰色地帶。
延伸閱讀:Is Ethereum Headed For $1,000 After Losing Key Support?
結語
去中心化 AI 數據市集,是對一個真實經濟問題的具體技術回應:在 AI 發展歷程中,真正產生訓練數據的個人,長期以來幾乎分不到任何價值。
透過智能合約、內容定址儲存(content-addressed storage)、聯邦學習(federated learning)及押注機制(token staking)等組合,有機會建立一套新系統,讓價值可以在沒有平台中介「抽佣」的情況下,更直接流向貢獻者手中。
但這個模式仍處於早期階段。
代幣經濟模型仍在摸索成熟;驗證系統仍要證明自己能在數以百萬計貢獻者規模下,抵禦操控與濫用;圍繞「個人數據貨幣化」的監管環境,暫時亦遠未塵埃落定。
然而,需求端的結構性壓力卻不會消失。
AI 開發者未來只會需要更多、更豐富、更多樣化的數據,而單靠中心化來源,愈來愈難穩定滿足。
正是這種長期、結構性的需求,使得去中心化數據市集,仍然具備一個值得關注的長線投資與發展命題。
下一篇:XRP Risks 30% Drop As Whale Activity And RSI Both Collapse

