Design · Development · Thoughts

안녕하세요,
Practical AI Lab 입니다.

AI·에이전트·LLM 실전 연구

GPT-Live-1 API 가격·기능, 음성 에이전트 도입 조건


반응형

음성 대화와 백엔드 작업의 분리를 전화 수화기와 연결된 빛으로 표현한 이미지

GPT-Live-1 API 가격은 2026년 9월 17일 공식 모델 문서 기준 음성 세션 분당 0.05달러이며, 초 단위로 과금됩니다. 동시에 듣고 말하는 음성 에이전트를 만들 수 있지만, 추론을 맡는 백엔드 모델과 도구 사용료는 별도입니다. 이 글은 현재 제공 기능과 전체 비용을 계산하는 방법, 도입 전에 확인할 조건을 다룹니다.

이 글의 핵심
  • API 제공 범위와 입력·출력 제한
  • 음성 모델·백엔드·앱이 나누는 책임
  • 세션 요금 계산과 동시 접속 한도
  • 기존 에이전트를 연결하는 두 가지 선택지
  • 대화·업무·중단·비용을 나눈 도입 점검
먼저 팩트체크할 부분

발표에서 말하는 자연스러운 대화와 업무 처리 성능은 같은 평가 항목이 아닙니다. 아래에서는 지원 기능, 계산 예시, 작성자의 운영 권고를 구분합니다.

공식 원문: GPT-Live-1 API 발표 · 현재 모델 명세와 가격


1. GPT-Live-1 API에서 무엇을 사용할 수 있나?

동시 듣기·말하기와 업무 완료 확인, 음성 과금과 백엔드 비용을 구분한 표

음성과 텍스트를 주고받는 Live 모델

모델 ID는 gpt-live-1이며, 전용 Live 세션 경로는 v1/live/sessions입니다. 모델 명세에는 음성·텍스트 입출력이 지원되고 이미지·영상은 지원되지 않는다고 표시돼 있습니다.

기존 Realtime 요청과는 구분

현재 명세상 이 모델은 v1/realtime에서 지원되지 않습니다. 기존 Realtime 클라이언트의 모델 이름만 바꾸면 된다고 생각하면 연결 단계부터 어긋날 수 있습니다.


2. 동시에 대화하면서 도구 작업은 어떻게 처리하나?

사용자·음성 모델·백엔드와 권한 및 함수 실행을 맡는 앱의 연결 구조

음성 모델은 대화, 백엔드는 추론과 도구 선택

풀듀플렉스(full duplex)는 듣기와 말하기가 동시에 가능하다는 뜻입니다. GPT-Live는 대화를 이어가며 도움이 필요한 시점에 백엔드로 작업을 위임합니다. 사용자가 주문 상태를 물으면 백엔드가 조회하는 동안 사용자는 추가 정보를 말할 수 있고, 결과가 준비되면 음성 모델이 이를 전달하는 구조입니다.

음성 프롬프트에는 말투와 위임 조건을 짧게 두고, 자세한 업무 규칙과 도구 절차는 백엔드에 둡니다. 공식 가이드는 Realtime이 하나의 모델에서 음성·추론·도구 선택을 수행하는 방식과 이 분리 구조를 대비합니다.

권한과 실제 업무 상태는 애플리케이션 책임

백엔드가 함수를 선택해도 사용자 권한 확인, 필수 동의, 자체 함수 실행, 영속적인 업무 상태 관리는 앱이 담당합니다. 예를 들어 예약 변경 도구라면 변경 가능 여부와 사용자 확인을 검사한 뒤 실행하고, 저장된 결과를 근거로 성공을 전달해야 합니다.

음성을 끊었다고 백엔드 작업이 자동 취소되지는 않습니다. 사용자가 “잠깐”이라고 했을 때 재생을 멈추는 처리와 진행 중인 예약 변경을 취소하는 처리는 별도로 설계해야 합니다. 이는 공식 시작 가이드가 명시한 주의 사항입니다.


3. GPT-Live-1 API 가격과 동시 접속 한도

음성 세션 요금과 백엔드 모델 및 도구·인프라 비용의 합산 구조

분당 가격을 세션 길이에 적용

모델 문서의 과금 기준은 음성 세션의 지속 시간입니다. 분 단위로 올림하지 않고 초 단위로 계산하며, 백엔드 Responses 호출은 선택한 모델과 도구의 일반 요금이 적용됩니다. 아래는 공식 단가에 시간을 대입한 산술 예시로, 청구 실측이나 전체 견적이 아닙니다.

가정한 세션 시간 음성 레이어 계산 음성 비용
90초 90 ÷ 60 × 0.05달러 0.075달러
10분 10 × 0.05달러 0.50달러
10분 세션 10회 100 × 0.05달러 5.00달러

총비용에는 여기에 백엔드 입력·출력, 유료 도구, 사용한 통신·운영 인프라 비용을 더해야 합니다. 따라서 “분당 0.05달러로 모든 고객 업무를 처리한다”는 견적은 성립하지 않습니다.

무료 티어와 동시 세션 수를 확인

현재 모델 표는 Free 티어를 지원하지 않으며, 한도 단위는 동시 세션 수입니다. Tier 1부터 5까지 각각 25·50·200·300·500개로 안내합니다. 이는 분당 요청 수나 일일 통화 건수와 다른 값이므로, 피크 시간에 겹치는 세션을 기준으로 프로젝트 접근 권한과 실제 한도를 확인해야 합니다.


4. 기존 에이전트에 연결할 때 어떤 방식을 고르나?

Responses 위임과 클라이언트 위임 비교

Delegation and tools는 두 가지 방식을 제시합니다. 관리형 흐름이 요구사항에 맞으면 Responses 위임으로 시작하고, 전달할 문맥이나 실행·결과를 앱이 더 세밀하게 통제해야 하면 클라이언트 위임을 선택하도록 안내합니다.

선택 기준 Responses 위임 클라이언트 위임
백엔드 요청·연결 GPT-Live가 관리 앱이 구성·운영
대화 문맥 GPT-Live가 제공 앱이 이력·상태를 선택
결과 전달 전 가공 관리형 흐름에 맞춤 앱에서 검증·삭제·결합 가능
적합한 조건 지원되는 Responses 설정·도구로 충분 다른 모델·기존 서비스·맞춤 라우팅 필요

여기서 클라이언트는 브라우저만을 뜻하지 않습니다. 애플리케이션이 운영하는 모델·에이전트·서비스를 백엔드로 붙일 수 있다는 실행 제어 방식의 이름입니다.

기존 프레임워크와 음성 연결을 따로 판단

이미 에이전트를 운영한다면 새 음성 모델 때문에 작업 실행기를 전부 교체할 필요가 있는지부터 따져볼 만합니다. 실행 환경까지 관리하는 서비스와의 차이는 OpenAI Agents API 출시, 기능·비용·도입 조건 정리를 함께 보면 구분하기 쉽습니다.

연결 경로는 브라우저용 WebRTC, 서버 통합용 WebSocket, 전화용 Telephony·SIP 안내로 나뉩니다. 브라우저 시작 예시는 HTTPS 또는 localhost 페이지, 마이크, API 키를 보관할 신뢰할 수 있는 서버를 요구합니다. 키를 웹페이지 코드에 넣는 방식은 피해야 합니다.


5. 도입 전에 어떤 테스트를 통과해야 하나?

대화 품질·업무 정확도·중단 처리·운영 비용의 네 가지 도입 검사

말이 자연스러운지와 업무가 맞는지 따로 검사

다음은 작성자의 도입 점검 권고입니다. 겹쳐 말하기·잠깐의 침묵·고유명사·숫자가 포함된 테스트 대화를 만들고, 음성 응답과 실제 도구 결과를 나란히 확인하십시오. 한국어 예약 번호를 정확히 알아듣는 것과 올바른 예약 레코드를 변경하는 것은 각각 검증할 항목입니다.

공식 시작 가이드도 세션 시작 이벤트, 실제 음성 응답, 백엔드 검색 결과를 서로 다른 확인 대상으로 설명합니다. 평가를 자동화할 때는 ADK 음성 에이전트 평가 방법: 실시간 대화·CI 검증 분석에서 다룬 대화 단위 테스트 관점도 참고할 수 있습니다.

작업 취소·연결 종료·접근 조건을 점검

  • 취소 요청 직전과 직후의 외부 시스템 상태를 대조합니다.
  • 일시적인 연결 끊김 후 같은 업무가 중복 실행되지 않는지 시험합니다.
  • 대화 종료 시 Live 세션을 닫고 최종 사용량을 수집합니다.
  • 선택한 백엔드 모델의 사용 권한과 실제 프로젝트 한도를 확인합니다.

6. Q&A와 정리

Q1. ChatGPT 유료 구독이 있어야 API를 쓸 수 있나요?

이 글에서 확인한 API 문서는 프로젝트 API 키와 API 사용 티어를 기준으로 안내합니다. ChatGPT 구독만으로 API 사용료나 접근 권한이 포함된다고 가정하지 말고, API 프로젝트에서 별도로 확인하십시오.

Q2. 세션 중 위임 방식을 바꿀 수 있나요?

공식 가이드는 위임 방식을 세션 생성 시 고르도록 명시합니다. Responses와 클라이언트 방식 사이를 전환하려면 새 세션을 시작해야 합니다.

Q3. 위임 이벤트만 받으면 사용자 요청을 알 수 있나요?

클라이언트 위임 이벤트에는 작업 본문이 아닌 메타데이터가 들어갑니다. 앱이 전사 이벤트와 업무 상태를 유지하고, 그 자료로 백엔드 요청 문맥을 구성해야 합니다.

Q4. 백엔드 결과를 검사하면 모든 발화를 사전 승인할 수 있나요?

공식 문서는 백엔드 결과 검토가 GPT-Live의 모든 발화를 승인하거나 검증 중 침묵을 보장하는 기능은 아니라고 설명합니다. 발화 제어가 엄격한 업무라면 별도의 재생 제어 요구사항까지 검토해야 합니다.

Q5. 한국어 통화 품질도 확인된 건가요?

이번 글은 한국어 실통화 벤치마크를 수행하지 않았습니다. 실제 고객이 쓰는 고유명사·발음·배경 소음을 넣은 테스트 없이는 한국어 업무 적합성을 단정할 수 없습니다.


7. 참고 자료

반응형