트웰브랩스가 피지컬 인공지능(AI)이 발전하면서 중요해진 1인칭 영상 속 데이터를 처리하는 비전언어모델(VLM) ‘페가수스 16’을 출시했다고 7일 밝혔다.
트웰브랩스는 멀티모달 영상 이해 AI 기업이다. 미디어, 엔터테인먼트, 스포츠, 공공 등 다양한 시장에서 방대한 영상 속 행동과 사건, 전후 맥락을 이해하는 범용 영상 이해 기술을 개발한다.
최근 피지컬AI의 가장 큰 해결 과제 중 하나는 1인칭 시점에서 촬영된 영상을 AI가 이해하는 것이다. 1인칭 영상 데이터를 에고센트릭 데이터(egocentric data)라고 하는데, 사람의 시선에서 촬영한 1인칭 영상 데이터를 뜻한다. 주로 작업자들이 액션캠, 스마트 글래스 등을 착용한 채로 특정 동작을 수행하는 모습을 촬영해 데이터를 수집한다.
다만 1인칭 영상을 확보하는 것만으로 로봇 학습 데이터가 완성되지 않는다. 학습에 적합한 장면을 선별하고 영상 속 사람의 행동을 구간별로 나눈 뒤, 손이 어떤 도구나 물체와 상호작용했으며 그 결과는 어땠는지 세부적으로 파악해야 한다. 사람의 눈이 영상을 식별하면 뇌에서 영상속 정보들을 처리하는 것과 같다.
페가수스 1.6은 △행동 분할과 라벨링 △상세 캡션 라벨링 △품질 평가 △검색과 큐레이션 △개인정보와 컴플라이언스 탐지의 5가지 핵심 기능을을 통해 영상 속 데이터들을 분류하고 학습에 활용할 수 있는 형태로 정제한다.
모델이 영상 속 사람의 행동과 주변 사물, 전후 맥락을 함께 이해해 작업을 구간별로 나누고 설명할 수 있다.
예를 들어 작업자가 특정 부품을 집고 도구를 이용해 작업한 뒤 완성된 물체를 옮기는 장면에서 각각의 행동과 등장하는 사물, 행동 순서를 파악해 구조화할 수 있다.
이재성 트웰브랩스 최고경영자(CEO)는 “그동안 트웰브랩스가 일관되게 추구해온 방향은 기계가 영상을 통해 현실 세계가 어떻게 작동하는지 이해할 수 있도록 만드는 것이었다”며 “피지컬 AI는 이런 방향에서 자연스럽게 한 단계 더 나아간 결과”라고 말했다.






![[MK시그널] 마르쿠스 코퍼레이션 매도신호 포착, 수익률 50.7% 달성](https://pimg.mk.co.kr/news/cms/202610/07/news-p.v1.20261007.41a6eec828be4527806a7e6175dc9d02_R.jpg)




![[올해의 우수게임] 인디게임 부문 에이아이엑스랩 '골목길: 귀흔'](https://img.etnews.com/news/article/2026/09/15/news-p.v1.20260915.89c0e72940034b11a0c403463341e3a5_P1.png)






English (US) ·