每一次搜尋、滑手機或使用 App,你都在產生數據。
對 AI 公司來說,這些數據價值以「數十億美元」計算,但真正掌握資料的平台卻攬走幾乎所有利潤,使用者與標註者能分到的只是微薄酬勞。
新一代的去中心化 AI 數據市集,試圖顛覆這種格局──利用加密貨幣,讓「提供數據的人」在自己的資料被用來訓練機器學習模型時,直接獲得報酬。
這遠不只是口號式的「擁有你的數據」。
背後還牽涉到多層驗證機制、質押 (staking) 系統、隱私保護技術,以及一整套代幣經濟設計——這些要素最後共同決定:你提供的資料,是拿到合理報酬,還是分文未得。
以下從底層機制開始拆解,說明這些系統究竟怎麼運作。
重點整理
- 去中心化 AI 數據市集,將「持有原始數據的人」與「需要標註、驗證訓練集的 AI 開發者」直接撮合,透過加密代幣以無需信任的方式完成支付。
- 供應者提交數據後,會經由鏈上或去中心化預言機網路驗證,通過後智能合約才會自動放款,傳統平台在收益分配中被移出中間角色。
- 聯邦學習、零知識證明等隱私技術,讓數據在不離開裝置、不曝露原始內容的前提下仍能被「變現」。
- 質押、懲罰機制與聲譽分數等代幣經濟設計,驅動供應者提交高品質數據,而非垃圾內容。
- 像是 Solana 上的 Kled AI 等專案代表目前前沿嘗試,但整體模式已橫跨多條公鏈與多種競爭架構。
為何 AI 公司極度飢渴數據,現在又是誰在買單?
大型語言模型(LLM)、影像辨識系統對數據的需求,很難被誇大。
一次前沿模型訓練,就可能吃掉數千億字元的文字資料、數百萬筆已標註影像,或是以「年」為單位累積的人類行為軌跡。
這些資料不會憑空出現。
目前主要來源大致有幾種:
- 大規模網路爬蟲,收集公開可見的文字內容。
- 平台授權交易,讓 AI 實驗室得以合法存取封閉資料庫——像是 Reddit、新聞媒體、圖庫平台都陸續簽過授權。
- 群眾外包標註平台,以低廉時薪付費給人工標註者,請他們幫忙標影像、轉錄音訊、評分 AI 回覆品質。
標註市場規模龐大,但高度「掠奪性」:集中式平台上的標註工,多半每小時收入約 1 到 5 美元,而他們標出的資料集,轉手賣給 AI 開發者時,單筆資料的售價往往被放大數十倍。
問題在於結構本身:一個集中式平台夾在「數據持有人」與「AI 買方」中間,攫取了絕大部分利潤;它決定價格、制定品質標準,也可以單方面封鎖供應者,幾乎沒有申訴空間。
去中心化數據市集試圖用智能合約、開放協議與代幣化支付軌,取代這個平台層。
什麼才算是真正的「去中心化 AI 數據市集」?
從本質上看,去中心化 AI 數據市集是一套協議,讓數據供給與需求雙方在沒有「中心控管者」的情況下互動成交。
買方多半是 AI 開發團隊或研究機構,會在鏈上提出「數據需求單」,裡面寫明:
- 需要什麼類型的資料
- 資料品質與標準
- 格式規範
- 每筆通過驗證的資料願意支付多少
賣方則是個人貢獻者或資料聚合者,負責依需求提供數據。
中間的智能合約扮演「託管帳戶」角色。
當買方發布需求時,先把資金鎖進合約。供應者提交資料並通過驗證後,合約才自動釋出對應款項。
雙方不需要互信,只需要信任合約程式碼。
真正的數據本身通常不會存放在鏈上。
把數十 GB 的標註影像直接放在 Ethereum (ETH) 或 Solana (SOL) 上,成本高得不可思議。
實務上,資料會存放在像 IPFS、Arweave 等去中心化儲存網路,鏈上記錄的則是「內容雜湊值」——也就是檔案的獨特指紋。
智能合約會檢查供應者提交的雜湊值是否對應到一份「未被竄改、已驗證」的檔案,確認無誤後才放款。
內容雜湊(content hash)是一串由檔案內容精確計算出來的字元,只要檔案內容改動一個位元,雜湊值就會完全不同。因此,事後幾乎不可能用「修改過或回收再利用」的數據欺騙系統拿錢。
延伸閱讀:Techdollar 完成 300 萬美元募資,助新創員工在不賣股下套現
沒有中心審核員,驗證數據品質怎麼辦?
在這種設計裡,「驗證」是最棘手的問題。
集中式平台可以雇用審核員看圖、看文、抽查品質,但智能合約本身不會「看圖說話」,它只會執行邏輯。
去中心化數據市集主流上採三種方式,通常會混合使用:
1. 密碼學證明:
適用於可以用數學方式驗證正確性的結構化數據。
例如 GPS 軌跡、感測器數據或財務紀錄,供應者可以附上零知識證明(zero-knowledge proof),證明這筆資料:
- 於某時間點產生
- 落在合理範圍內
- 來自特定裝置
而不必揭露原始數值本身。
2. 群眾驗證:
適合「主觀標註」任務。
市集會讓多名獨立貢獻者針對同一筆資料進行標註或評分,再由合約比較結果:答案與多數人一致的獲得報酬,長期偏離多數的則被視為問題帳戶。
這是把傳統平台常用的「重複標註」機制,搬到鏈上的去中心化版本。
3. 質押與懲罰機制(slashing):
在前兩層之外再疊一層「經濟約束」。
供應者要先質押平台原生代幣才能提交數據;如果其作品一再被群眾驗證層否決、或被判定為惡意灌水,質押代幣就會被「砍倉」——部分甚至全部沒收。
對貢獻者而言,提交低品質或造假數據會變成一筆實際可觀的成本,如此其行為誘因才會真正與買方的品質要求對齊。
延伸閱讀:XRP 測試 1 美元支撐,0.60 美元暴跌風險升溫
隱私保護技術如何守住貢獻者的底線?
這個模式的直覺疑慮就是:隱私。
如果使用者把自己的瀏覽紀錄、甚至健康數據直接賣給 AI 開發者,雖然價值不低,但暴露風險也同樣真實。
去中心化數據市集目前主流會用兩大技術路線來降低風險:
聯邦學習(Federated Learning)
原始數據完全不離開貢獻者裝置。
模型不是把資料拉回伺服器訓練,而是把 AI 模型本身「派送」到使用者端,先在本機資料上進行訓練,只把更新後的「模型權重」回傳給開發者。
權重是一組抽象的數學參數,無法直接還原出原始資料內容。多位貢獻者的權重更新再被聚合,形成更強的模型,而訓練資料始終未離開使用者環境。
差分隱私(Differential Privacy)
在數據分享前,有系統地加入隨機噪音,使任何單一個體的紀錄難以被「反推出來」,同時保留整體統計結構,讓資料仍然對訓練有用。
噪音強度可以調整:噪音越大,隱私保障越強,但數據實用性會略降。
這些技術同時也是監管面的關鍵。
歐盟 GDPR、加州消費者隱私法等,都對個資的傳輸與使用設下嚴格規範。若一個市集能有說服力地證明,整個流程中從未傳輸「可識別的原始個資」,在合規路徑上會比直接販售原始資料的模式輕鬆許多。
延伸閱讀:HIVE 以零利率融資 1.15 億美元,押注 AI 轉型、淡出比特幣挖礦
代幣經濟、質押機制與貢獻者實際怎麼拿錢?
各平台支付細節不同,但多數會採用「原生功能型代幣」,而非直接用 Bitcoin (BTC) 等主流資產結算。這枚代幣通常同時扮演數個角色:
1. 計價單位:
買方以平台代幣報價與支付需求,等於讓代幣直接反映「需求面價值」:數據需求越多,為了下單就需要越多代幣。
2. 供給側質押與鎖倉:
供應者必須持有並質押代幣才能參與市集,市場流通量因此部分被鎖住,也讓供應者的利益與整個網路健康綁在一起。
3. 聲譽與歷史紀錄:
很多協議會把「質押與被接單歷史」直接寫進鏈上作為聲譽分數的一部分:長期保持質押、作品穩定通過驗證、從未被砍倉的供應者,自然能建立可查證的履歷。
這種聲譽可轉化為議價能力:買方更願意為「有紀錄、可信賴」的供應者支付溢價,而不是把預算砸在完全沒歷史的新帳號上。
實際上一筆付款流程可能長這樣:
- 買方發布需求,並先把 500 枚平台代幣存入智能合約託管。
- 某供應者提交 50 筆已標註資料。
- 驗證層審核通過。
- 智能合約自動釋出:
- 50 枚代幣給供應者
- 2 枚代幣給參與這次驗證的節點或標註審核者
- 剩餘 448 枚代幣繼續保留給之後提交資料的供應者
- 買方在付款確認後,即可存取這批已驗證的數據紀錄。
代幣經濟能否長期運作,關鍵在於「對數據的真實需求」是否存在。若專案一開始只靠高額獎勵與投機炒作吸引供應者,但缺乏 AI 團隊願意掏錢買資料,代幣價格與整個市集最終都難以為繼。 代幣獎勵如果只發給貢獻者、卻沒有真正付費的 AI 開發者在市場另一端接手,最終只會形成通膨式的拋壓,這種代幣經濟結構難以長期維持。
延伸閱讀:OpenAI Delays $1 Trillion IPO As Market Volatility Tests Altman's Ambitions
Kled AI 與類似專案如何在 Solana 上落地這套模式
在 Solana 生態中,Kled AI 可說是這一類模型的代表性案例。該協議自我定位為一個去中心化資料市集,讓個人可以將自身資料貨幣化,專門用於 AI 模型訓練。Solana 具備低手續費與高吞吐量,特別適合高頻、小額的資料微支付場景:在 Solana 上,為一張標註好的圖片支付極小單位代幣仍具經濟可行性,而在 Ethereum 主網上幾乎做不到。
Solana 的架構在速度上也佔優勢。只要資料驗證完成,就必須迅速觸發付款結算;若要貢獻者接受這個市場,就不能讓他們為了一筆款項等上好幾個小時。Solana 的亞秒級終局性,讓整體支付體驗接近傳統平台的即時感,同時又保留智慧合約的去信任特性。
與 Kled AI 同步受到關注的 Velvet 則走不同路線,它是 AI 驅動的鏈上投資終端,整合現貨交易、永續合約與收益策略。它之所以跟這個主題相關,在於同樣體現了共同底層邏輯:AI 系統直接讀取鏈上資料運作,並以加密代幣作為結算媒介。若說 Kled AI 是為「原始訓練資料」打造市場,Velvet 則可視為消化這些處理後市場資料的 AI 應用,是同一條資料經濟供應鏈的兩端。
其他同領域專案包括率先在 Ethereum 提出「資料代幣化資產」概念的 Ocean Protocol,以及專門獎勵用戶貢獻閒置頻寬與瀏覽行為給 AI 訓練管線的 Grass。這些專案在架構設計上各有差異,但核心模式一致:透過密碼學機制,對經驗證的資料貢獻進行自動化支付。
延伸閱讀:Anthropic’s Mythos Freeze Opens The Door For Asian Challengers Sakana AI And 360
誰真正受惠?這個模式背後的風險又是什麼?
對個人資料貢獻者來說,吸引力相當直接:過去被平台免費拿走的價值,現在可以自行收回。一個擁有大量社群影響力、具備專業領域知識,或能提供稀缺資料類型的人——例如醫療紀錄、專業法律文件、非英語內容等——在一個有真實 AI 開發需求的市場中,能夠取得實質溢價。
對 AI 開發者而言,去中心化資料市集提供的是,以傳統爬蟲或授權管道難以取得的資料類型。人類偏好回饋資料、利基領域的標註內容,以及來自弱勢語言與冷門地區的多語資料,本質上相當稀缺。若有協議能在大規模情境下穩定蒐集並驗證這些資料,其價值相當可觀。
不過風險同樣存在於雙方。首先是代幣價格波動:今天以原生代幣領到的報酬,等到貢獻者真的要花用時,折算成法幣可能已大幅縮水;對買方則反向而行——從規劃採購到實際下單期間,若代幣價格暴漲,資料成本就可能遠高於原先預算。
其次是資料品質這個老問題,在大規模環境下依舊難解。群眾驗證與押注(staking)機制可以壓低詐欺行為,但無法徹底杜絕。技巧成熟的惡意參與者有能力長期操弄信譽系統,而 AI 開發者若從一個尚未驗證、缺乏紀錄的新市集購買資料,所承擔的品質風險,明顯高於向歷史悠久的標註服務商合作。
最大的不確定性來自監管。個資貨幣化位於多重法規交會處:一方面牽涉隱私與資料保護法,另一方面又涉及作為支付工具或投資標的的代幣證券監理,加上仍在成形中的 AI 治理框架。某個市場在甲國完全合規,到了乙國卻可能落入法律灰色地帶。
延伸閱讀:Is Ethereum Headed For $1,000 After Losing Key Support?
結語
去中心化 AI 資料市集,其實是對一個真實經濟問題的具體技術回應:歷來為 AI 提供訓練資料的人,幾乎從未真正分享過資料價值。
透過智慧合約、內容定址儲存、聯邦式學習與代幣質押等技術組合,這套系統讓資料價值得以直接流向貢獻者,而非被平台中介吃下大部分利潤。
然而,這個模式仍處在早期階段。
代幣經濟設計還在進化中;驗證機制必須證明能在不被濫用的前提下,支撐上百萬級貢獻者;圍繞個人資料貨幣化的監管環境,也遠未定案。
但需求面並不會消失。
AI 開發者需要更多、更豐富且更多元來源的資料,而集中式資料供應已難以穩定滿足這種結構性需求。
正是這樣的長期結構缺口,撐起了去中心化資料市集的中長期投資敘事。
下一步閱讀:XRP Risks 30% Drop As Whale Activity And RSI Both Collapse





