"834년치 영상도 AI가 분석"…트웰브랩스, 美 로봇 학습 시장 침투 [K-챌린저]

자체 개발 AI모델 '마렝고'·'페가수스'로 수십만 시간 영상 24시간 내 처리
스포츠·미디어 넘어 로봇 학습으로 확장…국내선 제조업 안전·공정 개선 공략

이재성 트웰브랩스 대표. (트웰브랩스 제공)

(서울=뉴스1) 정윤영 기자 = 로봇이 사람처럼 물건을 집어 옮기거나 공장에서 복잡한 작업을 수행하려면 실제 사람들이 어떻게 움직이고 일하는지 학습해야 한다. 이를 위해서는 방대한 영상 자료가 필요하지만 수백만 시간에 달하는 영상을 일일이 확인하고 정리하기는 어렵다.

영상 이해 인공지능(AI) 기업 트웰브랩스가 스포츠·미디어 시장에서 축적한 기술을 로봇과 휴머노이드의 학습 데이터 처리에 적용하며 피지컬 AI 시장 공략에 나선 배경이다.

2일 이재성 트웰브랩스 대표는 뉴스1과의 서면 인터뷰에서 "미디어·스포츠 분야에서 축적한 영상 이해 기술이 피지컬 AI와 산업 AI의 데이터 처리 문제를 해결하는 데 활용될 수 있다"고 말했다. 로봇 학습에 필요한 영상 데이터가 급증하면서 대용량 영상을 빠르게 처리하는 기술의 중요성이 커지고 있다는 설명이다.

트웰브랩스는 최근 미국의 한 로봇 학습 데이터 기업과 계약을 맺고 수십만 시간에 달하는 영상을 24시간 안에 토큰화하는 작업을 완료했다. 해당 고객사 한 곳에서 요청한 연간 영상 분석 규모만 최소 730만 시간으로, 한 사람이 하루 24시간 쉬지 않고 시청하더라도 약 834년이 걸리는 분량이다.

이 대표는 "원본 데이터가 아무리 많아도 이를 사용할 수 있는 처리 인프라가 없다면 무용지물이 된다"며 대규모 영상 데이터를 실제 AI 학습에 활용할 수 있도록 가공하는 기술의 중요성을 강조했다.

수십 년 치 영상 하루 만에 처리…스포츠·미디어 기술로 로봇 학습

2020년 설립된 트웰브랩스는 영상에 등장하는 인물과 사물뿐 아니라 행동과 사건의 전후 맥락까지 분석하는 AI 기술을 개발하는 기업이다. 미국 샌프란시스코에 본사를 두고 있으며 한국에서는 연구개발을 중심으로 사업을 전개하고 있다.

기존에는 스포츠 구단과 방송사 등 방대한 영상 자료를 보유한 기업들이 주요 고객이었다. 방송·경기 영상을 사람이 직접 살펴보지 않더라도 원하는 장면을 문장으로 검색하거나 영상의 내용을 요약할 수 있도록 돕는 방식이다.

실제 미국프로농구(NBA) 토론토 랩터스 등 여러 스포츠 구단을 보유한 메이플리프 스포츠 앤드 엔터테인먼트(MLSE)는 트웰브랩스의 기술을 도입한 뒤 약 16시간이 걸리던 영상 검색 작업을 9분 수준으로 줄였다.

드라마 '워킹 데드'로 알려진 미국 미디어 기업 AMC 글로벌 미디어 역시 트웰브랩스와 협력으로 사내 영상 검색 시스템을 구축해 등장인물의 이름뿐 아니라 특정 행동이나 상황을 문장으로 입력해 원하는 장면을 찾을 수 있도록 했다.

국내에서는 유니세프한국위원회가 트웰브랩스의 영상 이해 AI를 도입했다. 유니세프한국위원회는 수십 년간 축적한 8TB 규모의 영상·이미지 자료를 자연어로 검색할 수 있도록 시스템을 구축하면서 필요한 자료를 찾는 데 걸리는 시간을 95% 단축했다.

최근 트웰브랩스가 주목하는 시장은 로봇과 휴머노이드의 학습 데이터다. 로봇이 사람의 행동을 배우려면 작업 과정을 촬영한 영상을 확보하는 것뿐 아니라 필요한 행동과 상황을 찾아내고 전후 맥락을 구분해 학습에 활용할 수 있는 데이터로 정리해야 하기 때문이다.

트웰브랩스는 영상에 담긴 정보를 AI가 처리할 수 있는 숫자 형태의 정보 단위인 '토큰'으로 변환하는 기술을 활용하고 있다. 사람의 움직임과 작업 과정을 담은 대규모 영상을 AI가 분석할 수 있도록 준비하는 것으로, 영상이 늘어날수록 이를 빠르게 처리할 수 있는 인프라가 중요해진다.

트웰브랩스가 자체 개발한 AI 모델 '마렝고'는 영상을 검색 가능한 형태로 변환하고, '페가수스'는 영상 속 사건과 맥락을 분석해 설명하는 역할을 한다. 영상에서 일부 장면만 추출해 분석하는 방식과 달리 시간의 흐름에 따라 행동과 사건의 전후 관계를 파악하도록 설계한 것이 특징이다.

트웰브랩스는 이러한 영상 처리 기술을 바탕으로 향후 1년 내 미국 로봇 학습 데이터 고객사의 영상 분석 수요가 하루 수십만 시간 이상으로 확대될 것으로 예상하고 있다.

이 대표는 "수집되는 영상이 많아질수록 이 작업을 사람의 수작업으로는 감당하기 불가능해지며 이를 위한 영상 처리 인프라도 중요해진다"고 설명했다. 이어 "로봇이 영상에서 배우려면 먼저 영상을 이해하고 학습에 활용할 수 있는 데이터로 정제하는 과정이 필요하다"고 강조했다.

트웰브랩스의 영상 이해 AI 모델 '마렝고 3.5' 관련 이미지. (트웰브랩스 제공)
美 로봇 학습·韓 제조 현장 공략…작업자의 경험도 AI 자산으로

트웰브랩스는 미국과 한국에서 각각 확보한 고객 기반을 토대로 사업 영역을 확대하고 있다. 미국에서는 기존 미디어·스포츠 및 공공안전 분야를 기반으로 로봇과 휴머노이드의 학습 데이터 시장을 공략하고, 한국에서는 자동차·반도체·조선 등 제조업 현장의 산업 안전과 공정 개선 수요에 대응하는 전략이다.

제조 현장에서는 작업 카메라와 검사 장비, 폐쇄회로(CC)TV 등을 통해 매일 방대한 영상이 생산되지만 실제 업무에 활용되는 정보는 제한적이다. 트웰브랩스는 이 같은 영상에서 작업자의 행동을 분석해 안전 수칙이나 표준작업절차 준수 여부를 확인하고, 공정별로 실제 작업에 필요한 시간과 불필요하게 소요되는 시간을 구분하는 등의 활용 방안을 추진하고 있다.

설비의 이상 징후를 파악하거나 작업 과정에서 반복적으로 발생하는 문제를 찾아내는 것도 적용 분야다. 트웰브랩스는 현재 이러한 목적으로 영상 AI 도입을 추진하는 산업 AI 고객사들과 협력하고 있으며, 앞으로 미국에서도 산업 안전과 공정 혁신 분야의 고객을 확보하고 한국에서는 로봇·휴머노이드 학습 데이터 시장으로 사업을 넓힐 계획이다.

이 대표는 "한국은 반도체, 자동차, 조선 등 세계적인 제조 기반을 갖춘 나라"라며 제조 현장의 생산성과 안전을 높이기 위한 AI 수요가 큰 만큼 한국에서 확보한 산업 AI 활용 사례를 미국 등 해외 시장으로 확장하겠다는 구상도 밝혔다.

美 VC 업계서 2억 달러 유치…영상 이해 모델 고도화

사업 확대를 위한 투자도 확보했다. 트웰브랩스는 올해 7월 미국 벤처캐피털(VC) NEA와 네이버벤처스가 공동 주도한 시리즈B 투자에서 1억 달러(약 1500억 원)를 유치했다. 아마존 등 글로벌 기업도 투자에 참여했으며 누적 투자 유치액은 2억 달러를 넘어섰다. 확보한 자금은 영상 이해 모델 고도화와 응용 제품 확대 등에 투입하고 있다.

트웰브랩스가 궁극적으로 지향하는 것은 영상에 담긴 작업자의 경험과 노하우를 기업과 AI가 지속적으로 활용할 수 있는 자산으로 만드는 것이다. 새로운 영상과 과거의 사건을 연결해 필요할 때 다시 찾아볼 수 있는 '현장 기억'을 구축하고, 이를 설비·공정·작업 이력과 연계해 축적한다는 구상이다.

예컨대 숙련 작업자가 특정 설비에 문제가 생겼을 때 어떻게 대응했는지 영상으로 기록하고, 향후 비슷한 상황이 발생했을 때 과거 사례를 찾아 활용하는 방식이다. 장기적으로는 이러한 정보를 실제 제조 현장에 투입되는 로봇과 휴머노이드의 학습에도 활용한다는 목표다.

이 대표는 "숙련 작업자 개인에게 머물렀던 노하우를 기업 차원의 자산으로 축적해 필요할 때 활용할 수 있도록 하겠다"고 설명했다. 그는 "카메라가 기록한 경험이 AI의 배움으로 이어지고, 그 배움이 다시 현실 세계에서 쓰이도록 하는 것"이 궁극적인 목표라고 밝혔다.

(트웰브랩스 제공)

yoonge@news1.kr