우리가 검색하고, 웹을 돌아다니고, 앱을 만질 때마다 새로운 데이터가 쌓인다.
이 데이터는 AI 기업 입장에서 수십억달러 가치가 있지만, 지금은 이를 수집하는 소수의 플랫폼이 대부분의 이익을 가져간다.
여기에 맞서 새롭게 부상하는 것이 탈중앙화 AI 데이터 마켓플레이스다. 블록체인과 암호화폐를 활용해, 사용자가 제공한 데이터가 실제로 머신러닝 모델 학습에 쓰일 때마다 직접 보상을 지급하겠다는 구조다.
단순히 “데이터를 소유하라”는 구호를 넘어, 이 생태계에는 검증 레이어, 스테이킹 시스템, 프라이버시 제약, 토큰 경제학이 촘촘히 얽혀 있다. 이 요소들의 설계에 따라 기여자가 공정한 보상을 받느냐, 아니면 한 푼도 못 받느냐가 갈린다.
이 글은 이러한 시스템이 아래에서부터 어떻게 작동하는지 구조적으로 풀어본다.
요약
- 탈중앙화 AI 데이터 마켓플레이스는 원천 데이터를 가진 개인과, 라벨링·검증된 학습 데이터를 필요로 하는 AI 개발자를 직접 연결하고, 결제는 신뢰가 필요 없는 암호화폐 토큰으로 처리한다.
- 기여자가 제출한 데이터는 온체인 혹은 탈중앙 오라클 네트워크를 통해 검증된 뒤에야 대금이 풀리며, 기존 중앙 플랫폼이 가져가던 마진을 스마트컨트랙트가 대체한다.
- 연합학습(federated learning), 영지식증명(zk-proof) 등 프라이버시 보호 기술을 적용해 원본 데이터는 기여자 단말기를 떠나지 않은 상태에서 수익화가 가능하다.
- 스테이킹·슬래싱·평판 점수 등 토큰 경제 설계를 통해 ‘쓰레기 데이터’ 대신 정교한 데이터를 제출하도록 인센티브를 정렬한다.
- 솔라나 기반 Kled AI 같은 프로젝트가 현재 프론티어를 형성하고 있지만, 유사한 모델은 여러 체인과 다양한 아키텍처로 확장되는 중이다.
AI 기업이 왜 그렇게 많은 데이터를 필요로 하고, 지금은 누가 비용을 내는가
대규모 언어모델(LLM)과 이미지 인식 모델의 데이터 수요는 상상을 초월한다.
최신 프런티어 모델 한 번을 학습시키는 데도 수천억 개의 텍스트 토큰, 수백만 장의 라벨링된 이미지, 수년치에 해당하는 인간 행동 데이터가 들어간다.
이 데이터는 어디선가 가져와야 한다.
지금까지의 공급 경로는 크게 세 가지 정도로 좁혀진다.
먼저, 웹 스크래핑을 통해 공개 웹 텍스트를 대량 수집한다. 여기에 레딧, 뉴스 퍼블리셔, 스톡 포토 에이전시 등과의 독점 라이선스 계약을 통해 비공개 데이터세트를 가져온다.
마지막으로, 크라우드소싱 라벨링 플랫폼이 있다. 수많은 작업자가 소액의 보수를 받으며 이미지를 분류하고, 오디오를 필사하고, AI 응답의 정확성을 평가한다.
라벨링 시장은 규모는 크지만 수익 구조는 착취적이다. 중앙화 플랫폼에서 일하는 작업자는 시간당 1~5달러 수준을 받는 반면, 이들이 만든 라벨링 데이터세트는 AI 개발사에 훨씬 더 비싼 가격으로 판매된다.
문제의 근원은 구조다. 데이터 소유자와 AI 바이어 사이에 중앙화 플랫폼이 끼어 가격을 사실상 독점적으로 정하고, 품질 기준을 일방적으로 부과하며, 기여자를 임의로 퇴출시킬 수 있다. 탈중앙화 마켓플레이스는 이 중개 레이어를 스마트컨트랙트·오픈 프로토콜·토큰 기반 결제 레일로 치환하려 한다.
함께 읽기: USDT Briefly Dethrones Ethereum As Crypto’s No. 2 Asset
탈중앙화 AI 데이터 마켓플레이스란 무엇인가
본질적으로 탈중앙화 AI 데이터 마켓플레이스는, 데이터 수요와 공급이 특정 중앙 사업자 없이 직접 맞물리는 프로토콜이다.
수요 측은 AI 개발사나 연구팀이다. 이들은 “데이터 요청서(data request)”를 올리면서 어떤 유형의 데이터가 필요한지, 품질 기준과 포맷, 검증 조건, 그리고 검증된 레코드당 얼마를 지불하겠는지 명시한다.
공급 측은 개인 기여자 또는 데이터 어그리게이터(집계자)다. 이들이 해당 요청을 충족하는 데이터를 제출한다.
이 사이를 연결하는 것이 스마트컨트랙트다. 일종의 에스크로 계정 역할을 한다.
바이어가 요청서를 올리면 지정된 금액을 컨트랙트에 먼저 예치한다. 이후 기여자가 데이터를 제출해 검증을 통과하면, 컨트랙트는 미리 정해진 규칙에 따라 자동으로 대금을 지급한다.
어느 쪽도 상대를 신뢰할 필요가 없다. 이들이 신뢰하는 것은 코드에 박힌 계약 조건이다.
데이터 자체는 대개 온체인에 저장하지 않는다.
수십 기가바이트에 달하는 이미지·비디오 데이터를 이더리움 (ETH)이나 솔라나 (SOL) 위에 올리는 것은 수수료 측면에서 사실상 불가능하기 때문이다.
대신 데이터는 IPFS, Arweave 같은 탈중앙 스토리지 네트워크에 저장하고, 온체인에는 해당 파일의 콘텐츠 해시, 즉 ‘지문’만 올린다.
스마트컨트랙트는 기여자가 제출한 해시가 사전에 검증된, 변조되지 않은 파일의 해시와 일치하는지 확인한 뒤에야 대금을 풀어준다.
콘텐츠 해시는 파일 내용 전체를 수학적으로 요약한 짧은 문자열이다. 파일의 단 한 바이트만 바꿔도 해시가 완전히 바뀌기 때문에, 추후에 내용을 살짝 바꾸거나 재탕한 데이터로 대금을 청구하는 것이 사실상 불가능해진다.
함께 읽기: Techdollar Raises $3M To Let Startup Workers Cash In Without Selling
중앙 심사자 없이 데이터 품질은 어떻게 검증하나
이 구조에서 가장 어려운 지점이 바로 검증이다. 중앙화 플랫폼은 품질 심사 인력을 고용해 데이터를 직접 평가할 수 있지만, 스마트컨트랙트는 이미지를 ‘보거나’ 텍스트 라벨의 적정성을 ‘판단’할 수 없다. 오직 코드를 실행할 뿐이다.
탈중앙 마켓플레이스는 보통 세 가지 접근을 조합해 이 문제를 푼다.
암호학적 증명은 구조화된 데이터에 적합하다. GPS 경로, 센서 수치, 금융 거래 기록처럼 수학적으로 검증 가능한 데이터의 경우, 영지식증명(zk-proof)을 활용해 “이 데이터가 특정 범위와 규칙을 만족하며, 특정 시간·특정 디바이스에서 수집됐다”는 사실만 증명한다. 원본 수치 값은 끝까지 공개하지 않는다.
크라우드 검증은 주관성이 큰 라벨링 작업에 쓰인다. 여러 독립 기여자가 동일한 데이터 조각을 보고 각자 평가를 제출하면, 스마트컨트랙트는 응답을 비교해 다수 의견과 일치하는 기여자에게 보상을 지급하고, 반복적으로 동떨어진 답을 내는 계정은 페널티를 준다. 중앙화 라벨링 업체가 쓰는 ‘중복 라벨링’ 기법을 온체인으로 옮겨온 셈이다.
스테이킹·슬래싱은 여기에 경제적 레이어를 더한다. 기여자는 플랫폼의 네이티브 토큰을 일정량 예치해야만 데이터 제출 권한을 얻게 된다. 이후 제출한 데이터가 반복적으로 기각되거나, 크라우드 검증 레이어에서 악의적·허위 데이터로 판정되면 예치금의 일부 혹은 전부가 ‘슬래싱’된다. 저품질 데이터를 뿌리는 것이 오히려 손해가 되도록 설계해, 바이어의 품질 요구와 기여자의 인센티브를 일치시킨다.
함께 읽기: XRP Tests $1 Support As $0.60 Crash Risk Deepens
프라이버시는 어떻게 지키나
이 모델에서 가장 큰 긴장은 프라이버시다. 사용자가 브라우징 히스토리나 건강 데이터를 AI 개발사에 판다면 경제적 가치는 크지만 노출 위험도 그만큼 크다. 탈중앙 마켓플레이스는 성숙 단계에 접어든 두 가지 기술을 통해 이 문제를 다룬다.
**연합학습(Federated learning)**은 원본 데이터를 기여자 단말기 밖으로 절대 내보내지 않는다. 데이터를 서버로 올리는 대신, 학습시킬 AI 모델을 기여자의 기기로 내려보낸다. 모델은 로컬에 저장된 원본 데이터를 바탕으로 기기 안에서만 학습을 진행하고, 이후 업데이트된 모델 가중치(수학적 파라미터)만 개발자에게 전송한다. 여러 기여자의 업데이트가 서버에서 다시 집계돼 더 나은 글로벌 모델을 만든다. 학습 데이터는 끝까지 기여자 환경을 떠나지 않는다.
**차등 프라이버시(Differential privacy)**는 데이터를 공유하기 전에 통계적으로 조정된 ‘노이즈’를 섞는 기법이다. 이를 통해 개별 사용자의 특정 기록을 역추적하는 것은 사실상 불가능하게 만들면서도, 전체 데이터셋이 가진 통계적 패턴은 보존해 학습용으로서의 효용을 유지한다. 노이즈 강도는 조절 가능하며, 더 강한 프라이버시를 원하면 데이터 효용을 조금 희생하는 구조다.
이 기술들은 규제 대응에서도 핵심적인 의미를 갖는다. 유럽연합의 GDPR, 미국 캘리포니아 소비자 프라이버시법(CCPA) 등은 개인정보의 이전·활용에 엄격한 제한을 둔다. “원본 개인정보가 외부로 전송되지 않는다”는 점을 기술적으로 입증할 수 있는 마켓플레이스는, 단순히 원시 데이터를 수출·판매하는 모델보다 규제 리스크가 훨씬 낮다.
함께 읽기: HIVE Just Borrowed $115M At Zero Percent To Bet Against Bitcoin Mining
토큰 경제, 스테이킹, 그리고 실제 보상 구조
플랫폼별 세부 구조는 다르지만, 대부분은 비트코인 (BTC) 같은 메이저 자산 대신 자체 유틸리티 토큰으로 결제를 처리한다. 이 토큰은 세 가지 축에서 기능한다.
첫째, 데이터 거래의 회계 단위다. 바이어는 토큰 단위로 데이터 요청 가격을 제시하고, 데이터 수요가 늘수록 해당 토큰에 대한 실수요가 함께 증가한다.
둘째, 공급 측 스테이킹 수단이다. 기여자는 마켓플레이스 참여를 위해 일정량의 토큰을 보유·예치해야 하므로, 유통 물량 일부가 잠기고, 네트워크 건전성과 본인 평판에 대한 이해관계가 생긴다.
셋째, 평판의 토대다. 장기간 스테이킹을 유지하고, 제출 데이터가 꾸준히 승인되며, 슬래싱 이력이 없는 기여자는 블록체인 상에 검증 가능한 트랙레코드를 쌓는다. 이러한 평판 점수는 곧 프리미엄 요율로 이어져, 신규 참여자보다 더 높은 단가를 제시받을 수 있다.
실제 결제 흐름은 대략 이렇다. 바이어가 데이터 요청서를 올리며, 예를 들어 500 토큰을 컨트랙트 에스크로에 예치한다. 한 기여자가 라벨링된 레코드 50건을 제출하고, 검증 레이어가 이를 승인한다고 하자. 그러면 스마트컨트랙트는 기여자에게 50 토큰, 검증에 참여한 밸리데이터들에게 2 토큰을 분배하고, 남은 448 토큰은 이후 기여자들을 위한 예치금으로 유지한다. 바이어는 결제가 확정되는 즉시 검증된 데이터셋에 대한 접근 권한을 얻게 된다.
토큰 경제는 데이터에 대한 실질 수요가 있을 때만 의미가 있다. 초기에 높은 토큰 가격만 내세우고, 실사용 데이터 요청 없이 토큰 판매에만 의존하는 프로젝트는 지속 가능성이 떨어진다. 기여자에게는 토큰 보상을 지급하면서, 반대편에서 실제로 데이터를 사들이는 AI 개발자 수요가 따라오지 않으면, 토큰 인플레이션 압력만 키우는 구조가 되어 지속 가능하지 않다.
또 읽어보기: 오픈AI, 변동성 커지는 시장 속에서 1조달러 IPO 연기…앨트먼의 빅딜 제동
솔라나에서 구현되는 Kled AI 등 유사 프로젝트의 구조
Kled AI는 솔라나(Solana) 생태계에서 이 모델이 어떻게 구현되고 있는지를 가장 잘 보여주는 사례다. 이 프로토콜은 개인이 자신의 데이터를 AI 모델 학습용으로 제공하고, 그 대가를 직접 받을 수 있는 탈중앙 데이터 마켓플레이스를 표방한다. 솔라나는 거래 수수료가 낮고 처리량이 높기 때문에, 데이터 경제에 필수적인 ‘초소액·고빈도 결제’가 가능하다. 한 장의 라벨링된 이미지를 제공하고 토큰의 일부분만 받는 구조가 메인넷 이더리움에서는 비경제적이지만, 솔라나에서는 충분히 성립한다.
솔라나의 아키텍처는 속도 면에서도 의미가 크다. 데이터 검증이 완료되어 대금이 풀리는 결제는 빠르게 정산되어야 한다. 기여자 입장에서는 결제 확정을 몇 시간씩 기다려야 하는 마켓은 받아들이기 어렵다. 솔라나의 ‘1초 미만 파이널리티’는 여전히 스마트 컨트랙트의 신뢰 최소화(trustless) 속성을 유지하면서도, 결제 경험만큼은 전통 플랫폼에 가까운 체감을 제공한다.
Kled AI와 함께 주목받는 **벨벳(Velvet)**은 다른 방향에서 같은 흐름을 보여준다. 벨벳은 스팟·퍼페추얼·수익 전략을 한데 묶은 AI 기반 온체인 포트폴리오 터미널이다. 온체인 데이터를 직접 활용하고, 정산은 암호화폐 토큰으로 이뤄진다는 점에서 같은 계열에 속한다. Kled AI가 원천 학습 데이터에 대한 시장을 만드는 쪽이라면, 벨벳은 그런 데이터가 가공·집계된 ‘시장 데이터’를 실제로 소비하는 AI 애플리케이션 사례다. 데이터 경제 파이프라인의 양 끝단을 각각 보여주는 셈이다.
이 영역을 개척해 온 다른 프로젝트로는 이더리움 기반 데이터 자산 토큰화 개념을 먼저 선보인 오션 프로토콜(Ocean Protocol), 그리고 유휴 대역폭·브라우징 데이터 제공에 대해 보상을 지급하며 AI 학습 파이프라인을 구축하는 그래스(Grass) 등이 있다. 설계 방식은 조금씩 다르지만, ‘검증된 데이터 기여에 대해 암호학적으로 강제되는 지급을 수행한다’는 핵심 메커니즘은 공유한다.
또 읽어보기: 앤스로픽 ‘미토스’ 동결에 사카나 AI·360 등 아시아 도전자 부상
누가 이 모델의 수혜자인가, 그리고 리스크는 무엇인가
개인 데이터 제공자에게 이 모델의 매력은 직관적이다. 지금까지는 플랫폼이 공짜로 가져가던 가치를, 데이터 생성자가 직접 회수할 수 있기 때문이다. 영향력이 큰 소셜 미디어 계정, 특정 분야 전문지식, 희소한 데이터(의무기록, 전문 법률 문서, 비영어권 콘텐츠 등)를 보유한 개인은, 실제 AI 개발 수요가 붙는 마켓에서는 상당한 프리미엄을 요구할 수 있다.
AI 개발자 입장에서는 탈중앙 마켓을 통해 크롤링이나 기존 라이선스 계약으로는 구하기 어려운 데이터에 접근할 수 있다는 점이 강점이다. 사람의 선호를 반영한 피드백 데이터, 극도로 좁은 도메인의 라벨링 데이터, 저개발·저대표 지역에서 생산된 다국어 콘텐츠는 실제로 희소하다. 이를 대규모로 조달·검증해 주는 프로토콜이 있다면, 그 자체로 실질적인 가치를 제공한다.
다만 양측 모두에 리스크도 만만치 않다. 우선 토큰 가격 변동성이다. 오늘 네이티브 토큰으로 보상을 받은 기여자가, 실제 쓰려는 시점에는 달러 기준 가치가 크게 떨어져 있을 수 있다. 반대로 구매자 입장에서는 데이터 구매 계획을 세웠을 때보다 실제 결제 시점에 토큰 가격이 급등할 경우, 데이터 조달 비용이 예산을 크게 초과할 위험을 떠안게 된다.
데이터 품질 역시 대규모로 가면 미해결 과제에 가깝다. 집단 검증, 스테이킹 기반 슬래싱 등으로 사기를 줄일 수는 있지만, 완전히 제거할 수는 없다. 정교한 공격자는 시간과 노력을 들여 평판 시스템을 교란할 수 있고, 트랙레코드가 짧은 신규 마켓플레이스에서 데이터를 구매하는 AI 개발자는, 오랜 업력을 가진 전통 라벨링 벤더에게서는 크지 않았던 품질 리스크를 떠안게 된다.
규제 리스크는 사실상 최대의 변수다. 개인 데이터의 수익화는 개인정보 보호법, 해당 토큰의 증권성 판단, 아직 정립 단계인 AI 거버넌스 규제까지 여러 영역이 교차하는 지점에 놓여 있다. 한 관할 지역에서는 규정을 준수하는 마켓이, 다른 관할에서는 법적 ‘그레이 존’에 놓일 수 있다.
또 읽어보기: 이더리움, 핵심 지지선 붕괴 후 1,000달러까지 추락하나
맺음말
탈중앙 AI 데이터 마켓플레이스는, 실제로 존재해 온 경제적 불균형—훈련 데이터를 만든 사람이 그 가치 대부분을 놓쳐 온 구조—에 대해 기술적으로 구체화된 해답을 제시하는 시도다.
스마트 컨트랙트, 콘텐츠 주소 기반 스토리지, 연합 학습, 토큰 스테이킹 등의 조합은, 플랫폼 중개자가 마진을 가져가지 않고도 가치가 곧장 기여자에게 귀속되는 구조를 설계할 수 있게 한다.
다만 이 모델은 아직 초기 단계다. 토크노믹스는 성숙 과정에 있고, 검증 시스템은 수백만 명의 기여자가 참여해도 ‘농간’을 허용하지 않는다는 것을 입증해야 하며, 개인 데이터 수익화를 둘러싼 규제 환경도 여전히 유동적이다.
그러나 수요 측의 구조적 요인은 사라지지 않는다. AI 개발자는 더 많은 종류의 데이터를, 기존 중앙화 소스가 안정적으로 공급하지 못하는 규모로 필요로 한다. 바로 이 구조적 수요가, 탈중앙 데이터 마켓플레이스의 장기적인 투자 논리를 지탱하는 기반이다.

