GPT-Realtime-2는 GPT-5의 지능을 음성 API에 적용합니다
OpenAI는 수요일에 API에 차세대 음성 모델을 공개하여 개발자들이 음성 요청을 분석하고, 70개 이상의 언어로 번역하고, 음성을 실시간으로 텍스트로 변환하는 앱을 구축할 수 있는 도구를 제공했습니다.
이 세 가지 모델은 각각 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper라고 명명되었습니다. 이 모델들은 AI 음성 인터페이스를 단순한 질문과 답변 교환을 넘어 AI 에이전트가 대화 도중에 듣고, 생각하고, 행동할 수 있는 영역으로 끌어올립니다.
GPT-Realtime-2는 음성 인식에 더욱 정교한 추론 기능을 제공합니다
GPT-Realtime-2는 OpenAI의 플래그십 모델입니다. OpenAI는 이 모델이 이전 버전인 GPT-Realtime-1.5보다 크게 향상된 GPT-5급 추론 능력을 제공한다고 밝혔습니다.
벤치마크인 Big Bench Audio에서 15.2% 더 높은 점수를, 오디오 지능여러 차례의 음성 대화에서 지시를 따르는 능력을 테스트하는 Audio MultiChallenge에서 13.8% 더 높은 점수를 기록했습니다.
이번 실질적인 개선 사항은 실제 음성 에이전트를 개발하는 개발자를 대상으로 합니다. 이 모델은 이제 기존 32K 제한에서 4배 증가한 128K 컨텍스트 창을 지원하며, "최소"에서 "매우 높음"까지 5단계로 조정 가능한 추론 노력 수준을 제공합니다
이 시스템은 여러 도구를 동시에 호출하고, 음성 응답으로 오류를 복구하며, 요청을 처리하는 동안 "확인해 보겠습니다"와 같은 짧은 연결 문구를 생성할 수 있습니다.
GPT-Realtime-Translate는 실시간 음성 번역을 지원합니다. 70개 이상의 입력 언어를 지원하며, 13개 언어로 출력하여 화자의 말하는 속도에 맞춰 실시간으로 번역합니다.
GPT-Realtime-Whisper는 스트리밍 음성-텍스트 변환(STT) 기능을 제공하여, 발화가 완료될 때까지 기다리지 않고 말하는 즉시 단어를 텍스트로 변환합니다.
질로우와 도이치텔레콤은 실제 생산 환경에서 모델을 테스트하고 있습니다
여러 회사가 조기에 서비스를 이용할 수 있었습니다. 질로우는 복잡한 부동산 관련 질문을 처리하고, 매물 검색 도구를 호출하며, 공정 주택 규정을 준수할 수 있는 음성 비서를 개발 중입니다.
해당 회사는 GPT-Realtime-2를 사용한 즉각적인 최적화 후 가장 까다로운 공격자 대상 벤치마크에서 통화 성공률이 26포인트 향상되어 이전 69%에서 95%로 증가했다고 보고했습니다.
도이치텔레콤은 고객 지원을 위한 실시간 번역 서비스를 테스트 중이며, 이를 통해 발신자는 원하는 언어로 말할 수 있고 모델이 양쪽 모두에서 번역을 처리합니다.
프라이스라인은 음성 기반 여행 도우미를 개발 중인데, 이 도우미는 항공편 검색, 호텔 변경, 현지 통역까지 한 번에 처리할 수 있을 것으로 예상됩니다.
이 모델들은 고객 서비스 역량을 확장하려는 기업을 대상으로 하지만, 교육, 미디어, 이벤트 및 크리에이터 플랫폼 전반에 걸쳐 잠재적인 적용 가능성도 언급했습니다.
오픈아이(OpenAI)는 밝혔습니다 . 회사는 이러한 안전장치가 스팸, 사기 및 기타 형태의 악용을 방지하는 데 도움이 된다고 설명했습니다.
가격 책정 방식은 Translate 및 Whisper 모델의 경우 분 단위로, GPT-Realtime-2 모델의 경우 토큰 사용량 단위로 계산됩니다. 세 모델 모두 OpenAI의 Realtime API를 통해 이용 가능하며, WebRTC, WebSocket 및 SIP 연결 방식을 지원합니다.
에 대한 무료 영상을 시청하세요. 나만의 은행이 되는 방법










코멘트 (0)
$ 버튼을 클릭하고, 종목 코드를 입력한 후 주식, ETF 또는 기타 티커를 연결합니다.