OpenAI, 동시 청취·발화가 가능한 GPT‑Live‑1 API 출시

1 hour ago 2

GPT‑Live‑1 API는 듣기와 말하기를 동시에 처리하고, 복잡한 추론과 작업은 연결된 모델·도구에 위임해 백엔드 작업 중에도 대화를 이어갈 수 있음 단일 음성 모델이 입력·출력 오디오를 함께 처리하므로 음성 인식–추론–음성 합성을 연결하는 구조의 지연과 불안정한 단계 간 인계를 피할 수 있음 초기 평가에서 Speak는 기존 턴 기반 시스템 대비 끼어들기를 거의 80% 줄임. OpenAI의 Full Duplex Bench에서는 GPT‑Realtime‑2.1보다 30%포인트 높은 성능을 보였으며, GPT‑6 Astra의 중간 추론 설정과 결합해 Tau3 1위를 기록함 시스템 프롬프트로 말투·속도·대화 스타일을 조정하고 백엔드 모델과 에이전트 하네스를 선택할 수 있으며, 전화 통화·배경 소음 처리·장시간 대화·전사문·명시적 턴 경계도 지원함 프런트엔드 음성 계층은 분당 0.05달러이며, 작업별 추론 깊이·속도·비용에 맞춰 백엔드를 결합할 수 있음. 기업은 OpenAI Presence를 통해 실시간 음성 업무 흐름을 구축할 수도 있음 동시 청취·발화와 대화 제어 ChatGPT에서 처음 공개한 GPT‑Live를 GPT‑Live‑1 API로 제공하며, 음성 앱과 기업 업무 흐름에 활용할 수 있음 듣기와 말하기를 동시에 수행하고, Codex 및 ChatGPT Work 시연처럼 연결된 모델과 도구에 더 깊은 추론과 작업을 위임할 수 있음 끼어들기 처리는 들어오는 오디오와 나가는 오디오를 단일 모델이 함께 추론하는 방식으로 동작함 초기 평가에서 Speak는 언어 튜터가 답하기 전 학습자에게 생각할 시간을 더 주면서, 기존 턴 기반 시스템보다 끼어들기를 거의 80% 줄임 시스템 프롬프트로 에이전트의 말투·속도·대화 스타일을 제품과 사용자, 업무 목표에 맞게 조정할 수 있음 무음 컨텍스트 관리와 배경 소음 처리를 개선해 대화를 끊거나 모든 처리 단계를 소리 내어 말하지 않고 진행할 수 있음 장시간 상호작용에서도 컨텍스트 유지와 대화 품질이 개선됨 식당 예약부터 고객 지원까지 전화 통화용 전이중(full-duplex) 음성 에이전트를 배포할 수 있음 음성 계층을 단순화하고 백엔드를 선택하는 구조 기존 음성 에이전트는 음성 인식(STT)–추론 모델–음성 합성(TTS) 을 연결하므로, 각 인계 단계에서 지연이 늘고 타이밍·컨텍스트·대화 리듬을 잃을 여지가 생김 사용자가 끼어들거나 멈추거나 대화 방향을 바꿀 때의 단계 간 조율도 개...

Read Entire Article