오픈AI는 GPT‑Realtime‑2와 API를 통해서만 이용할 수 있는 두 가지 새로운 음성 버전을 발표했습니다

오픈AI는 GPT‑Realtime‑2와 API를 통해서만 이용할 수 있는 두 가지 새로운 음성 버전을 발표했습니다

17 hardware

OpenAI가 음성 API 기능을 확장합니다

회사는 개발자들이 더 "생동감 있는" 음성 애플리케이션을 만들 수 있도록 새로운 기능을 발표했습니다: 사용자와 대화하고, 말을 텍스트로 전사하며, 실시간으로 번역할 수 있습니다.

새로운 Realtime 모델
Realtime 인터페이스를 통해 이제 세 가지 모델이 제공됩니다:

모델 | 용도 | 주요 특징
GPT‑Realtime‑2 | 실시간 음성 상호작용 | 요청 분석, 도구 호출, 수정 처리 및 부드러운 대화 연속. GPT‑5 로직 기반으로 GPT‑Realtime‑1.5보다 더 복잡한 작업을 처리합니다.
GPT‑Realtime‑Translate | 실시간 번역 | 70개 이상의 입력 언어와 13개의 출력 언어를 지원합니다. 맥락, 지역 억양 또는 전문 용어가 바뀌어도 의미를 보존합니다.
GPT‑Realtime‑Whisper | 음성 전사 | 낮은 지연 시간의 스트리밍 모델로 오디오를 거의 즉시 텍스트로 변환합니다.

> “우리의 새로운 모델은 단순한 대화를 실시간으로 음성 인터페이스로 번역하여 실제로 듣고, 추론하고, 번역하며, 전사하고, 대화가 진행됨에 따라 행동을 취할 수 있도록 합니다.” – 회사 발표

비용
모델 | 가격
GPT‑Realtime‑2 | 입력 오디오 토큰 1백만개당 $32, 캐시된 토큰 1백만개당 $0.40, 출력 오디오 토큰 1백만개당 $64
GPT‑Realtime‑Translate | 분당 $0.034
GPT‑Realtime‑Whisper | 분당 $0.017

사용해 보기
개발자들은 OpenAI Playground 온라인 플랫폼에서 새로운 모델을 테스트하고 실시간으로 동작하는 모습을 바로 확인할 수 있습니다

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인