로봇 학습 데이터 조달 가이드: 공공 데이터셋부터 구축 업체 선정까지

로봇 학습 데이터를 구하는 경로는 네 가지입니다. 공공·공개 데이터셋으로 되는 구간과 안 되는 구간, 구축 업체를 고를 때 확인할 기준, 비용을 좌우하는 변수를 정리했습니다.

로봇 학습 데이터 조달 가이드: 조달 경로 4가지(공공 데이터셋·공개 연구 데이터셋·전문 구축 업체·자체 수집)

로봇과 피지컬 AI(Physical AI) 개발에서 가장 먼저 부딪히는 질문은 "학습 데이터를 어디서 구하는가"입니다. 텍스트나 웹 이미지와 달리 로봇 학습 데이터는 인터넷에 쌓여 있지 않습니다. 실제 공간, 실제 행동, 실제 객체를 담아야 하고, 그 데이터가 시뮬레이터에서 재사용될 수 있는 형식이어야 합니다. 이 글은 로봇 학습 데이터를 조달하는 4가지 경로와, 구축 업체에 맡길 때 확인해야 하는 기준을 정리한 가이드입니다.

수요는 정책이 먼저 확인해 줍니다. 정부는 2026년 6월 발표한 3대 메가프로젝트에서 피지컬 AI를 축으로 10대 업종별 데이터팩토리 구축을 내걸었고, 2030년까지 민·관 합동 20조원 투자를 계획하고 있습니다(디지털데일리, 2026-06-29). 데이터를 어디서, 어떤 품질로 조달하는가가 프로젝트 전체의 병목이 되는 시기입니다.

📌 3줄 요약
· 로봇 학습 데이터 조달 경로는 공공 데이터셋, 공개 연구 데이터셋, 전문 구축 업체, 자체 수집의 4가지이고, 각각 커버하는 구간이 다릅니다.
· 공공·공개 데이터셋은 시작점으로 유효하지만 우리 현장의 공간·객체·작업을 담지 못합니다. 현장 특화 구간은 구축 또는 수집이 필요합니다.
· 구축 업체를 고를 때는 실적의 규모보다 검증 방식을 먼저 확인해야 합니다. 어떤 기준으로 검수를 통과했는지, 데이터가 시뮬레이터에서 재사용 가능한 형식인지가 재작업 비용을 가릅니다.

조달 경로 4가지

1. 공공 데이터셋

AI-Hub를 비롯한 공공 포털은 한국어 환경의 시각·행동 데이터를 무상으로 제공합니다. 비용이 들지 않고 라이선스가 명확한 것이 장점입니다. 대신 범용 목적으로 구축된 데이터라 우리 로봇의 작업 환경과 차이가 있고, 원하는 시점에 원하는 항목이 추가되지 않습니다. 기술 검증 초기의 베이스라인 학습에 적합합니다.

2. 공개 연구 데이터셋

Open X-Embodiment처럼 연구 기관들이 공개한 로봇 조작 데이터셋은 다양한 로봇 폼팩터의 시연 데이터를 모아 놓았습니다. 파운데이션 모델의 사전 학습이나 벤치마크 비교에 유용합니다. 다만 대부분 해외 실험실 환경에서 수집돼 한국의 주거·산업 공간과 분포가 다르고, 상업 이용 조건은 데이터셋별 라이선스를 개별 확인해야 합니다.

3. 전문 구축 업체

우리 현장, 우리 작업에 맞는 데이터를 위탁 구축하는 경로입니다. 실제 공간을 스캔해 시뮬레이터용 3D 자산으로 만들거나, 사람의 행동을 다시점 카메라로 수집하거나, 시뮬레이션으로 변형 데이터를 대량 생성하는 작업이 여기에 들어갑니다. 비용은 가장 크지만, 자체 수집 체계를 내재화하지 않는 조직이 현장 특화 구간을 채우는 현실적인 경로입니다. 업체 선정 기준은 아래에서 따로 다룹니다.

4. 자체 수집

텔레오퍼레이션 장비나 모션캡처를 도입해 내부에서 수집하는 경로입니다. 데이터 주권과 반복 수집 능력을 확보하는 대신, 장비·인력·품질 관리 체계를 전부 내재화해야 합니다. 로봇 제조사처럼 데이터 수집이 본업과 붙어 있는 조직에 적합하고, 수요가 간헐적인 조직에는 고정비 부담이 큽니다.

로봇 학습 데이터 조달 경로 4가지: 공공 데이터셋, 공개 연구 데이터셋, 전문 구축 업체, 자체 수집의 커버 구간과 확인 사항
개념도: 조달 경로 4가지의 커버 구간과 확인할 것. 네 데이터 유형이 연결될 때 자산화와 합성 재생산이 가능합니다.

경로별 커버 구간: 무엇이 되고 무엇이 안 되는가

공공·공개 데이터셋으로 되는 것은 범용 동작의 사전 학습까지입니다. 우리 매장의 진열대, 우리 공장의 설비, 우리 제품의 형상을 로봇이 다뤄야 하는 순간부터는 그 공간과 객체를 담은 데이터가 필요합니다. 피지컬 AI 데이터가 공간(3D 자산), 행동(사람·로봇의 동작), 객체(조작 대상), 합성(시뮬레이션 재생산)의 네 유형으로 나뉘고 각 유형이 어떻게 만들어지는지는 피지컬 AI 데이터셋 구축 가이드에서 정리했습니다.

핵심은 네 유형이 연결돼야 한다는 점입니다. 실제 공간을 스캔한 3D 자산이 있어야 그 위에서 합성 데이터를 재생산할 수 있고, 실제 행동 데이터가 있어야 합성의 물리적 타당성을 검증할 수 있습니다. 조달을 유형별로 쪼개서 따로 사면 이 연결이 끊어집니다.

데이터가 얼마나 필요한가요?

절대량으로 답할 수 있는 질문이 아닙니다. 같은 작업이라도 로봇의 형태와 환경 변동 폭에 따라 필요량이 달라집니다.

대신 계획을 세울 때 쓸 수 있는 순서가 있습니다. 작업 하나를 정해 소량으로 먼저 수집하고, 그 데이터로 학습한 모델이 어디서 실패하는지 봅니다. 실패가 특정 조명이나 특정 객체에 몰려 있으면 그 조건만 추가로 수집하면 됩니다. 실패가 고르게 퍼져 있으면 수집 설계 자체를 다시 봐야 합니다.

전체 물량을 처음부터 확정해 계약하면 이 판단 구간이 사라집니다. 단계를 나눠 계약하는 편이 총비용에서 유리한 경우가 많습니다.

시뮬레이션 데이터만으로 학습할 수는 없나요?

합성 데이터는 물량을 늘리는 수단이고, 기준을 만드는 것은 실데이터입니다.

시뮬레이터는 조명·시점·배치를 바꿔 같은 장면을 수천 가지로 재생산합니다. 다만 그 변형이 물리적으로 타당한지 판정할 근거가 필요합니다. 실제 공간을 스캔한 3D 자산과 실제 사람의 행동 데이터가 있어야 합성 결과를 대조할 수 있습니다. 실데이터 없이 합성만 쌓으면 시뮬레이터 안에서만 동작하는 모델이 나옵니다.

순서로 보면 실데이터 수집과 자산화가 먼저고, 합성은 그 위에서 물량을 확보하는 단계입니다.

휴머노이드·로봇 학습 데이터 구축 업체는 무엇을 보고 고르나요?

① 검증 기준이 계약서에 있는가. 품질 판정 기준이 계약서에 명시돼야 합니다. 수량만 적힌 계약은 재작업 분쟁의 원인이 됩니다. 슈퍼브에이아이가 참여한 정부 과제에서는 완성 데이터가 IoU 0.7, 의미 정확성 90% 기준의 외부 검수를 통과했습니다. 어떤 기준이든, 제3자가 판정할 수 있는 형태로 계약 전에 합의하는 것이 재작업 분쟁을 막습니다.

② 실환경 수집 실적이 있는가. 실험실 데모와 실제 현장 수집은 난도가 다릅니다. 조명, 반사, 가림, 사람의 개입이 있는 공간에서 수집해 본 실적이 있는지, 그 규모가 어느 정도인지 확인합니다. 슈퍼브에이아이는 실제 가정 환경 50개소에서 고프로 17대 멀티뷰 리그로 사람의 행동을 수집해, 4억 프레임의 원시 영상을 108만 장의 정제 데이터로, 다시 30만 장의 학습용 자산으로 가공한 실적을 독파모 프로젝트에서 진행했습니다.

③ 시뮬레이터 호환 형식인가. 공간 데이터가 3DGS나 USD처럼 시뮬레이터에서 불러올 수 있는 형식으로 나오는지, 행동 데이터에 시점·관절 정보가 보존되는지 확인합니다. 형식이 맞지 않으면 데이터를 받고도 변환 비용이 다시 발생합니다. 실제 가정 공간을 3D 가우시안 스플래팅으로 디지털 트윈화한 과정을 참고할 수 있습니다.

④ 합성 재생산이 가능한가. 수집한 실데이터를 자산화해 시뮬레이션으로 변형 데이터를 만들어낼 수 있으면, 같은 예산으로 확보하는 데이터의 양이 달라집니다. 수집 단가와 함께 재생산 단가를 물어야 견적 비교가 성립합니다. Isaac Sim 기반 합성 데이터 파이프라인이 그 예입니다.

⑤ 검수·이력 체계가 있는가. 수집 일시, 장비, 환경 조건이 데이터에 메타데이터로 남는지, 불량 데이터를 걸러낸 이력이 추적되는지 확인합니다. 모델 성능이 안 나올 때 데이터로 원인을 역추적할 수 있는가의 문제입니다.

위탁 구축한 데이터의 소유권은 누구에게 있나요?

정해진 기본값이 없습니다. 계약서에 쓴 대로 갈립니다. 원시 데이터, 가공된 학습 데이터, 그 데이터로 만든 3D 자산의 소유권이 각각 다르게 설정되기도 합니다.

계약 전에 확인할 것은 세 가지입니다. 구축 업체가 같은 데이터를 다른 고객에게 재판매할 수 있는지, 우리가 그 데이터로 학습한 모델을 상업적으로 쓰는 데 제약이 있는지, 계약 종료 후 원본과 중간 산출물을 어떤 형식으로 받는지입니다.

세 번째를 놓치면 다음 업체로 옮길 때 처음부터 다시 수집해야 합니다. 공공·공개 데이터셋의 라이선스를 확인하는 것과 같은 비중으로 봐야 하는 항목입니다.

비용을 좌우하는 변수

로봇 학습 데이터 구축 비용은 고정 단가표가 없습니다. 견적을 가르는 변수는 네 가지입니다.

  • 수집 환경의 수와 다양성: 공간 1곳과 50곳은 장비 이동·섭외·촬영 일정이 선형 이상으로 벌어집니다.
  • 시점 수: 단일 카메라와 다시점 리그는 장비·동기화·후처리 비용이 다릅니다.
  • 가공 깊이: 원시 영상 전달까지인지, 정제·어노테이션·자산화까지인지에 따라 같은 촬영분도 견적이 달라집니다.
  • 합성 재생산 포함 여부: 초기 비용은 늘지만 데이터 단위당 비용은 내려갑니다.

정부 과제나 지원사업과 연계하면 실부담이 달라집니다. 슈퍼브에이아이가 참여한 독파모 과제는 LG AI연구원 주도 컨소시엄으로 진행됐고, 피지컬 AI 분야의 정부 투자는 위에서 본 것처럼 확대되는 추세입니다.

💬 로봇·피지컬 AI 학습 데이터 조달을 검토하고 계신가요? 아래에 데이터 유형과 목표 규모를 남겨주시면, 영업 전화가 아니라 공공 데이터셋으로 되는 구간과 구축이 필요한 구간의 구분부터 시작합니다.

슈퍼브에이아이는 산업 현장의 시각 데이터를 기업이 활용할 수 있는 인텔리전스로 전환하는 비전 인텔리전스 기업입니다. 실제 공간의 캡처와 자산화, 합성 데이터 재생산까지 피지컬 AI 데이터 파이프라인 전 과정을 제공합니다.