AI 확장의 다음 병목은 데이터다 — A Stargate for Data 읽기

Will DePue의 A Stargate for Data는 AI 산업의 관심이 컴퓨트에 치우쳐 있는 동안, 다음 병목은 데이터가 될 수 있다고 말한다. X에 올라온 원문 포스트는 이 문제의식을 짧게 던지고, LinkedIn 글은 그 배경을 길게 설명한다. Data 핵심 정리 핵심 주장: AI 발전은 모델 크기와 데이터 양을 함께 키우며 진행됐지만, 이제 공개 인터넷 데이터가 부족해지는 국면에 들어가고 있다. 전환점: 과거에는 GPU가 부족하고 인터넷 데이터는 충분했다. 앞으로는 컴퓨트가 커질수록, 각 산업의 비공개 지식과 실제 업무 데이터가 더 큰 병목이 된다. 시장 크기: DePue는 외부 데이터 벤더 지출이 이미 연간 약 70억 달러이며, 2030년에는 연간 1,000억 달러 이상으로 커질 수 있다고 본다. 경쟁 구도: 컴퓨트는 같은 칩과 비슷한 클러스터를 살 수 있지만, 데이터는 독점 계약·전문가 네트워크·품질 관리·도메인 커버리지로 차별화된다. 전략 질문: 컴퓨트를 위해 Stargate 같은 초대형 인프라를 만든다면, 데이터에도 그에 맞는 국가·산업 규모의 수집 프로젝트가 필요하지 않느냐는 질문이다. 1) 인터넷은 AI에게 주어진 일회성 보조금이었다 원문에서 가장 좋은 비유는 인터넷을 “한 번뿐인 보조금"으로 보는 관점이다. 딥러닝은 수십 년 동안 사람들이 의도치 않게 쌓아 둔 책, 블로그, 이미지, 영상, 논문, 토론 기록을 거의 한꺼번에 이용했다. 공개 웹은 모델이 세상을 배우는 거대한 기본 교재였다. ...

July 8, 2026 · 5 min