GPT-5.6 Sol은 OpenAI가 지금까지 출시한 최고의 비전 모델

4 hours ago 3

OpenAI의 GPT-5.6 제품군 Sol·Terra·Luna를 탐지·계수·OCR·데이터 추출 과제로 평가한 결과, Sol이 GPT-5.5보다 전반적으로 강한 비전 성능을 보임 가장 큰 개선은 객체 탐지로, Sol의 mAP@50이 GPT-5.5의 13.8에서 46.2로 상승했고 Terra와 Luna도 각각 44.7과 43.3을 기록함 객체 계수 정확도는 Sol 73.0%, Terra 67.6%, Luna 66.2%로 모두 GPT-5.5의 64.9%를 앞섰지만, OCR과 데이터 추출은 GPT-5.5와 비슷하거나 낮은 점수를 기록함 약 2,000×2,000픽셀 이상의 이미지에서는 탐지가 불안정해질 수 있으며, 추론 강도를 높이면 안정성이 개선되는 대신 토큰 사용량·지연시간·비용이 늘어남 Sol은 이미지당 약 10초와 2.5센트가 들었고, Gemini 3.5 Flash는 0.8센트로 탐지·계수에서도 앞서 대량 처리에 더 적합했으며, GPT-5.6은 에이전트·화면 이해·문서 처리에서 OpenAI의 선택지를 넓힘 GPT-5.6 비전 성능 평가 OpenAI는 GPT-5.6 제품군으로 Sol, Terra, Luna를 공개하고 데스크톱 애플리케이션을 탐색·조작하는 컴퓨터 사용 기능을 시연함 UI 에이전트와 세밀한 3D 시각화는 모두 강한 시각 이해 능력에 의존함 출시 예정인 VLM 벤치마크로 객체 탐지, 계수, OCR, 데이터 추출 성능을 평가함 Sol은 OpenAI의 기존 비전 모델 중 가장 강했으며, Terra와 Luna도 GPT-5.5보다 뚜렷하게 발전함 Roboflow Playground에서 GPT-5.6 제품군을 Claude Fable 5, Gemini 3.5 Flash 등과 같은 과제로 비교할 수 있음 객체 탐지의 큰 폭 개선 mAP@50은 GPT-5.5의 13.8에서 Sol 46.2로 상승했으며, Terra와 Luna도 각각 44.7과 43.3을 기록함 문서 레이아웃 탐지에서는 제목, 문단, 표, 이미지, 서명을 잘 처리함 문서 워크플로는 OCR이나 데이터 추출에 앞서 페이지에서 필요한 영역을 찾는 과정으로 시작되는 경우가 많음 알약과 달걀처럼 비슷한 물체가 조밀하게 배치된 장면에서도 Sol은 대부분을 탐지함 VLM은 클래스 레이블과 좌표를 텍스트로 생성하므로 물체가 많을수록 응답이 길어지고 누락·중복·좌표 오류 가능성도 커짐 GPT-5.6은 이미지 픽셀 기준의 절대 XYXY 좌표를 반환하도록 요청할 때 가장 좋...

Read Entire Article