
GPT-Live-1 API는 오픈AI(OpenAI)가 2026년 9월 10일에 공개한 풀 듀플렉스(full-duplex) 음성 모델입니다. 사람처럼 듣기와 말하기를 동시에 처리하며, 분당 0.05달러(초 단위 과금)에 개발자 누구나 음성 에이전트를 만들 수 있습니다. 기존 STT→LLM→TTS 파이프라인을 하나의 모델로 대체해 지연 시간과 코드 복잡도를 대폭 줄인 것이 핵심입니다.
GPT-Live-1이란? 기존 음성 AI와 뭐가 다를까
지금까지 음성 AI는 “내가 말을 끝내면 → 텍스트 변환 → 모델 추론 → 음성 합성” 순서로 작동했습니다. 그래서 끊김이 생기고, 말을 끊으면 엉뚱한 응답이 돌아오곤 했죠.
GPT-Live-1은 이 세 단계를 하나의 모델 안에서 처리합니다. 들으면서 동시에 대답하고, 사용자가 중간에 말을 끊어도 자연스럽게 대응합니다. 오픈AI에 따르면 의료 예약 서비스에서 이 모델을 적용한 결과, 불필요한 끊김이 80% 줄었다고 합니다.
7월 8일에 챗GPT(ChatGPT) 음성 모드의 기본 모델로 먼저 적용됐고, 9월 10일부터 개발자용 API로 정식 출시됐습니다.
GPT-Live-1 API 가격은 얼마인가요?
가격 구조가 단순합니다. 음성 프론트엔드(voice layer) 분당 0.05달러, 초 단위 과금이라 1분 미만도 쓴 만큼만 냅니다.
| 세션 시간 | 음성 레이어 비용 |
|---|---|
| 5분 | $0.25 |
| 10분 | $0.50 |
| 1시간 | $3.00 |
| 1,000분 | $50.00 |
다만 이건 음성 레이어만의 가격입니다. 백엔드에 붙이는 추론 모델(GPT-6 Astra, Luna 등)과 도구 호출 비용은 별도입니다. 실제 운영 비용은 음성 비용 + 백엔드 토큰 비용이니까, 프로토타입 단계에서 미리 계산해 보는 게 좋습니다.
GPT-Live-1 API 핵심 기능 6가지
- 풀 듀플렉스 대화 — 듣기와 말하기를 동시에 처리. 사용자가 말을 끊거나 “음”, “아” 같은 추임새를 넣어도 자연스럽게 이어갑니다.
- 백엔드 위임(delegation) — 복잡한 추론이나 도구 호출은 GPT-6 Astra 같은 텍스트 모델에 넘기고, 대화는 계속 진행. 고객센터 전화에서 “잠시만요” 없이 정보를 조회하는 게 가능합니다.
- 톤·속도·스타일 제어 — 시스템 프롬프트로 음성 에이전트의 말투, 빠르기, 대화 스타일을 지정할 수 있습니다.
- 배경 소음 대응 — 카페, 거리 같은 소음 환경에서도 대화를 유지하고, 불필요한 반응(“뭐라고 하셨죠?”)을 최소화합니다.
- 전화(telephony) 지원 — 레스토랑 예약, 고객 상담 같은 전화 기반 음성 에이전트를 바로 배포할 수 있습니다.
- 12개 새 음성 옵션 — 호주 영어, 다양한 억양과 방언을 포함해 음성 선택지가 넓어졌습니다. 커스텀 음성은 영업팀을 통해 별도 신청합니다.
벤치마크 성능은 어떤가요?
오픈AI가 공개한 평가 결과를 보면, GPT-Live-1은 이전 모델 GPT-Realtime-2.1 대비 상당한 폭으로 개선됐습니다.
| 항목 | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| 풀 듀플렉스 벤치(Full Duplex Bench) | 80.1% | 45.4% |
| 턴 테이킹 지연 시간 | 0.8초 | 1.4초 |
| 도구 호출 정확도 | 87% | 60% |
| 은행 음성 지원(pass rate) | 32% | 12.4% |
GPT-6 Astra를 백엔드로 연결하면 음성 에이전트 종합 벤치마크 Tau3에서 1위를 기록했습니다. 항공, 소매, 통신 도메인의 고객 서비스 태스크에서 측정한 결과입니다.
GPT-Live-1 API 시작하는 방법
개발자라면 아래 순서로 시작할 수 있습니다.
- 연결 방식 선택: 브라우저 앱은 WebRTC, 서버 사이드 오디오 통합은 WebSocket, 전화 에이전트는 텔레포니 가이드를 따릅니다.
- 대화 프롬프트 작성: GPT-Live-1에게 언제 백엔드에 위임할지, 어떤 톤으로 말할지를 시스템 프롬프트에 적어줍니다.
- 백엔드 모델 연결: 간단한 작업에는 Luna, 복잡한 추론에는 Astra, 또는 서드파티 모델도 연결 가능합니다.
- 테스트와 배포: 오픈AI가 제공하는 WebRTC 퀵스타트 예제로 마이크 입출력과 이벤트 채널을 바로 테스트할 수 있습니다.
API 엔드포인트는 v1/live/sessions이며, 기존 Chat Completions·Responses·Realtime·Assistants 엔드포인트와는 별개입니다. 무료 API 티어에서는 사용할 수 없고, Tier 1은 동시 세션 25개, Tier 5는 500개까지 지원됩니다.
어떤 서비스에 쓸 수 있을까?
실제 도입 사례와 예상 활용처를 정리하면 이렇습니다.
- 콜센터·고객 상담 — Yelp은 GPT-Live-1으로 레스토랑 예약과 음식 주문 전화를 처리하고, 통화 처리율이 눈에 띄게 올랐다고 밝혔습니다.
- 의료 예약·안내 — 한 헬스테크 기업은 코드베이스를 80% 줄이면서 환자와의 실시간 대화를 구현했습니다.
- 언어 학습 — Speak은 GPT-Live-1 적용 후 학습자가 생각할 시간을 더 확보할 수 있게 되면서 끊김이 80% 줄었습니다.
- 사내 음성 어시스턴트 — Codex와 연동하면 음성으로 코드 리포지토리를 검색하고 답을 받는 개발자 도구도 만들 수 있습니다.
- 금융 서비스 — 오픈AI는 최근 ChatGPT for Financial Services도 별도 출시했는데, GPT-Live-1과 결합하면 음성 기반 금융 상담 에이전트가 가능합니다.
정리
GPT-Live-1 API는 음성 AI 개발의 진입장벽을 확 낮춘 제품입니다. 분당 0.05달러로 풀 듀플렉스 음성을 쓸 수 있고, 백엔드 모델은 자유롭게 고를 수 있어서 비용과 성능을 유연하게 조절할 수 있습니다. 전화 상담, 예약, 언어 학습처럼 “끊기지 않는 대화”가 중요한 서비스라면 가장 먼저 검토해 볼 만합니다.
이 글은 투자 조언이 아닌 기술 동향 기록입니다.
자주 묻는 질문
GPT-Live-1 API 가격은 얼마인가요?
음성 프론트엔드 분당 0.05달러이며, 초 단위로 과금됩니다. 백엔드 추론 모델과 도구 호출 비용은 별도입니다. 10분 대화 기준 음성 레이어만 약 0.50달러입니다.
GPT-Live-1과 기존 Realtime API의 차이는 무엇인가요?
기존 Realtime API(GPT-Realtime-2.1)는 턴 기반으로 한쪽이 말할 때 다른 쪽은 대기합니다. GPT-Live-1은 풀 듀플렉스 방식으로 듣기와 말하기를 동시에 처리하며, 백엔드 모델에 추론을 위임하는 구조입니다.
무료로 사용할 수 있나요?
무료 API 티어에서는 GPT-Live-1을 사용할 수 없습니다. 유료 API 계정(Tier 1 이상)이 필요하며, 동시 세션 수는 티어에 따라 25~500개입니다.
한국어를 지원하나요?
GPT-Live-1은 다양한 언어를 지원하며 12개 새 음성 옵션이 추가됐습니다. 한국어 전용 음성이 별도로 공개되지는 않았지만, 다국어 처리 성능은 기존 ChatGPT 음성 모드와 동일한 수준입니다.
챗GPT 음성 모드와 같은 건가요?
같은 모델이지만 제공 방식이 다릅니다. ChatGPT 음성 모드는 소비자용 인터페이스(플랜별 시간 제한)이고, GPT-Live-1 API는 개발자가 자체 앱에 통합하는 용도입니다. 가격 체계, 동시 접속 제한, 백엔드 설정 등이 별도로 운영됩니다.
함께 보면 좋은 글
- ChatGPT 이미지 2.5 완전 정리: 스케치 기능부터 Flare·Sunburst 모델 비교까지 (2026)
- 아마존 x 챗GPT 광고 제휴 총정리: AI 대화 속 광고 시대가 열렸다 (2026)
- 그록봇 일상생활 활용: 쇼핑·여행·구독 정리까지 자동화하는 법 (2026)