每一次搜尋、滑社群、點開 App,你都在產生資料。
這些資料對 AI 公司而言價值以「十億」計,但真正拿走絕大多數價值的,是掌握平台的那一方,而不是提供資料的人。
新一代的去中心化 AI 數據市集,試圖翻轉這個結構——用加密貨幣,讓貢獻者在自己的資料被用來訓練機器學習模型時,直接拿到報酬。
這套機制,遠不只是「擁有你的資料」這麼簡單。
當中牽涉多層驗證機制、質押 (staking) 設計、隱私保護技術與代幣經濟,最後決定的是:你究竟能不能、以及能「公平」拿到多少錢。
以下從底層架構開始,拆解這些系統如何運作。
重點整理
- 去中心化 AI 數據市集,撮合握有原始資料的個人與需要已標註、可驗證訓練集的 AI 開發者,以加密代幣作為無需信任的支付管道。
- 貢獻者提交資料後,會先透過鏈上或去中心化預言機網路驗證,通過才會釋出款項,中間不再有抽成平台。
- 聯邦學習、零知識證明等隱私技術,讓資料得以變現,但原始敏感內容不需離開貢獻者裝置。
- 質押、懲罰機制與聲望分數等代幣經濟設計,將利害關係綁在一起,鼓勵貢獻者提供高品質資料而非垃圾。
- 以 Solana 上的 Kled AI 為代表的專案正站在前線,但這類模式正在多鏈、多種架構間快速擴散。
為什麼 AI 需要這麼多資料?現行是誰在買單?
大型語言模型與影像辨識系統對資料的飢渴程度,往往超乎想像。
前沿模型一次訓練,可能要吃掉數千億個文字 token、數百萬張已標註圖片,甚至是以「年」計的人類行為軌跡。
這些資料總得有來源。
目前主流來源大致有幾條路。
一是網路爬蟲,大規模蒐集公開網頁文字。二是平台授權,AI 實驗室直接向 Reddit、新聞媒體、素材庫等買授權資料。三是群眾外包標註平台,付費請工人幫忙標註圖片、轉錄音檔、評分 AI 回答好壞。
標註市場規模龐大,但高度「抽血」。 中央化平台上的標註工,多數每小時收入約 1 至 5 美元,而他們產出的資料集,轉手賣給 AI 開發者時,單筆價格往往被放大好幾個數量級。
問題在於結構。站在資料提供者與 AI 買方中間的中央化平台,吃掉了大部分毛利——由它訂價、由它決定品質標準,也可以隨時封殺貢獻者而不需交代。
去中心化市集則把這層平台,用智慧合約、開放協議與代幣支付軌道給取代掉。
去中心化 AI 數據市集到底是什麼?
從本質看,去中心化 AI 數據市集,就是一個讓「資料供給」與「資料需求」在沒有中心仲介下直接成交的協議。
買方是 AI 開發者或研究團隊,在鏈上發布「資料需求單」,列明需要的資料類型、品質標準、格式要求,以及每筆通過驗證的出價。
賣方則是個人貢獻者,或整合多方來源的資料聚合者,負責滿足這些需求。
智慧合約扮演的是第三方保管與結算層。
買方在發布需求時,先把資金鎖進合約。貢獻者提交的資料通過驗證流程後,合約便自動將相應款項釋出。
雙方不需要互信,只要信任公開的程式碼。
真正的資料本身,通常不會直接上鏈。
把幾 GB 的已標註圖片直接存在 Ethereum (ETH) 或 Solana (SOL) 上,成本高得難以接受。
實務上,多數專案會把資料放到 IPFS、Arweave 等去中心化儲存網路,鏈上只記錄一組「內容雜湊值」——就像檔案的獨一無二指紋。
智慧合約會檢查貢獻者提交的雜湊,是否與事先驗證過、未被竄改的檔案指紋一致,才會放款。
內容雜湊是一串由檔案內文「精準計算」而來的短字串。 只要檔案有一個 byte 被改動,雜湊值就會完全不同,使得事後幾乎不可能拿改過、或重複使用的舊資料來騙取報酬。
延伸閱讀:Techdollar 融資 300 萬美元,讓新創員工不必賣股就能套現
沒有中心審核員,資料怎麼驗證?
驗證,是這套設計裡最棘手的一環。中央化平台可以請一批審核人員,一筆一筆看。
但智慧合約無法「看」圖片,也不能自己判斷一段文字標註得對不對,只能執行邏輯。去中心化市集多半用三種方法組合解決這件事:
密碼學證明:適用於可被數學驗證的結構化資料。像 GPS 軌跡、感測器數據、財務紀錄等,貢獻者可以用零知識證明,證明資料滿足某些條件——例如在某時間範圍內、數值落在合理區間、來自特定裝置——卻不必揭露原始數值。
群眾驗證:適合主觀標註任務。多位獨立貢獻者會看到同一筆資料,各自給出標註。合約再比較所有結果,支付給與「多數答案」一致的人,對經常與共識背道而馳的帳號進行懲罰。這是一種去中心化的「重複標註」機制,用來抓出偷懶或惡意標註者。
質押與懲罰 (staking / slashing):在經濟層面再加一道關卡。貢獻者在能上傳資料前,必須先質押一定數量平台原生代幣。若其提交的資料一再被群眾驗證層否決,或被判定為造假,他的質押就會被「砍倉」,部分甚至全部沒收。這讓提交劣質資料變成一件「虧本」的生意,使貢獻者與買方的品質要求自然對齊。
延伸閱讀:XRP 再測 1 美元支撐,0.60 美元暴跌風險升高
隱私如何被保護?賣資料不必賣掉自己
這種模式最直覺的疑慮,就是隱私。如果使用者賣的是瀏覽紀錄、健康資料,價值很高,但風險也極大。去中心化市集主要靠兩套日漸成熟的技術來處理。
聯邦學習 (Federated Learning):原始資料完全留在貢獻者裝置上。不再把資料丟到中心伺服器訓練,而是把模型「送到」使用者端,在本地讀取資料並更新參數,最後只把更新後的模型權重(抽象的數學參數)傳回開發者。多個貢獻者的權重更新會被聚合起來,產出更好的模型;過程中,訓練數據從未離開貢獻者環境。
差分隱私 (Differential Privacy):在資料分享前,先刻意加入經過校準的統計噪音,確保從整體資料集中無法逆推出任何單一個體的具體紀錄,但仍保留對模型訓練有用的統計結構。噪音比例可調:噪音越多,隱私越強,但資料效用略降。
這些技術,對監管也至關重要。歐盟 GDPR、美國加州 CCPA 等法規,對個資跨境傳輸與用途都有嚴格限制。若一個市集能具體證明自己的流程中,原始個資從未離開使用者裝置,監管難題便比單純販售原始資料的模式小得多。
延伸閱讀:HIVE 發零息可轉債募 1.15 億美元,押注 AI 轉型、對賭比特幣挖礦
代幣經濟、質押與實際拿錢流程
各平台支付機制不盡相同,但多半採用原生功能型代幣,而非直接用 Bitcoin (BTC) 等主流資產支付。這枚代幣往往一幣多用:
第一,它是市集的計價單位。買方以代幣報價發出需求單,資料需求越大,願意鎖進系統的代幣就越多,代幣自然承載了需求端價值。
第二,質押製造了供給端鎖倉。貢獻者必須持有並質押代幣,才能參與市集,等於變相減少流通量,同時把貢獻者的利害與整體網路健康綁在一起。
第三,聲望往往與代幣歷史綁定。一位長期質押、提交紀錄多次被接受、從未被砍倉的貢獻者,在鏈上就有可驗證的信譽軌跡。這樣的帳號往往能為自己資料爭取更高單價,因為買方更願意相信他,而不是一個完全沒有歷史的新地址。
實務上的支付流程大致如下:假設有買方發出需求單,先在合約中存入 500 枚代幣作為保證金。某位貢獻者提交了 50 筆已標註紀錄,經驗證層審核通過後,智慧合約自動支付 50 枚代幣給貢獻者,2 枚代幣分給參與審核的驗證者,其餘 448 枚則繼續留在合約裡,等待後續其他貢獻者完成任務。只要付款確認無誤,買方便能存取這批已驗證的資料紀錄。
代幣經濟只在「真的有人要這些資料」時才站得住腳。 只靠發幣炒作、卻沒有實際資料需求的專案,終究難逃泡沫命運。 貢獻者一端不斷拿到代幣獎勵、但另一端卻沒有實際付費的 AI 開發者買家承接,等於整個市場合約只進不出,造成代幣通膨壓力,長期無法成立、也難以維持。
延伸閱讀:OpenAI 將 1 兆美元 IPO 計畫按下暫停鍵,市場震盪考驗 Altman 企圖心
Kled AI 等專案如何在 Solana 上落地這套模式
在 Solana 生態中,Kled AI 算是這一類模式的代表性案例。該協議自我定位為一個去中心化市集,讓個人可以將自身資料「商品化」,專門販售給需要訓練 AI 模型的開發者使用。由於 Solana 交易手續費低且吞吐量高,非常適合資料市集所需的高頻、小額支付場景——例如為一張標註好的圖片支付代幣的零頭,在 Solana 上具備經濟可行性,但在 Ethereum 主網上往往行不通。
Solana 的架構在速度面也相當關鍵。只要資料驗證完成就要觸發付款,這整個流程必須快速結算。若要貢獻者接受這個市集,他們不可能願意為了一筆小額款項,等上數小時才確認。Solana 具備亞秒級最終確認時間,讓整體付款體驗更接近傳統平台,同時又能保留智慧合約的去信任特性。
與 Kled AI 同步受到關注的 Velvet 則走另一條路:它是 AI 驅動的鏈上投資組合終端,整合現貨、永續合約與各類收益策略。它與這個領域的關聯在於,同樣展示出一個核心主軸:AI 系統直接在鏈上資料上運作,並透過加密代幣進行結算。若說 Kled AI 是為「原始訓練資料」打造市場,那 Velvet 則是下游應用,利用這些已被處理過的市場資料。兩者可視為同一條資料經濟供應鏈的兩端。
其他相關專案還包括 Ocean Protocol,早期就在 Ethereum 上提出「資料代幣化資產」概念;以及 Grass,主打使用者只要貢獻閒置頻寬與瀏覽資料,就能獲得 AI 訓練流程中的獎勵。這些項目在技術架構上各有差異,但核心模式相同:透過加密學機制,對經過驗證的資料貢獻進行自動化付款結算。
延伸閱讀:Anthropic「Mythos」暫停案為亞洲競爭者 Sakana AI、360 打開新窗口
誰真正受惠?潛在風險又在哪裡?
對個別資料貢獻者來說,誘因相當直接:過去被平台免費榨取的價值,如今可以由自己主動變現。擁有龐大社群聲量、具備高度專業領域知識,或握有稀缺資料類型的人,例如醫療紀錄、專業法律文件、非英語內容等,在一個存在真實 AI 開發者需求的市集中,都有機會獲得相當可觀的溢價。
對 AI 開發者而言,去中心化市集則提供了傳統爬蟲或授權模式難以取得的資料種類。像是人類偏好標註、利基領域標註資料、以及來自過去明顯被忽略地區的多語言內容,這些都是實際稀缺資源。若有一套協議能在大規模條件下,持續「搜羅+驗證」這類資料,就具有實質商業價值。
但風險同樣不小,而且是雙向存在。代幣價格波動意味著:今天用原生代幣收款的貢獻者,等到實際花用時,換算成法幣的價值可能已大幅縮水;反過來,買方也會面臨另一種風險:代幣在預算規劃與實際執行採購期間若大漲,他們的資料取得成本就會遠高於原先預期。
資料品質更是至今仍未完全解決的難題。群眾驗證機制與押注(staking)設計可以壓低詐騙比例,但無法徹底根除。具備高度技術能力的惡意參與者,可能長期經營帳號來操縱信譽系統;而 AI 開發者若選擇從全新、尚未建立口碑的市集購買資料,相較於與老牌標註服務商合作,自然會承擔更高的品質風險。
監管風險則是最大的不確定因子。將個資商品化,剛好踩在資料隱私法、相關代幣是否涉及證券監管,以及仍在成形中的 AI 治理框架三者的交疊地帶。一個在甲國看似完全合規運作的市集,到了乙國,可能立刻陷入灰色地帶。
延伸閱讀:以太幣失守關鍵支撐後,是否將下探 1,000 美元?
結語
去中心化 AI 資料市集,針對的是一個真實存在的經濟問題,而且給出的是具體、以技術為基礎的解答:歷來為模型提供訓練資料的人,幾乎沒有分享到任何價值回報。
透過智慧合約、內容位址化儲存(content-addressed storage)、聯邦式學習(federated learning)、以及代幣抵押機制的組合,這套系統嘗試讓價值可以直接流向貢獻者,而不再被平台中介者攔胡大部分利潤。
然而,這個模式仍屬起步階段。
代幣經濟設計還在摸索成熟路徑,驗證機制也亟需證明自己能在數百萬貢獻者規模下運作,而不被輕易操弄。至於個資商品化所牽涉的監管環境,也遠未底定。
但需求端的結構性現實並不會消失。
AI 開發者需要更多、更廣泛、更異質的資料,而集中式來源已愈來愈難以穩定滿足這些需求。
正是這種長期、結構性的供需缺口,撐起了去中心化資料市集的長期投資想像。

