Az OpenAI július 6-án bemutatta két új valós idejű hangmodelljét, a gpt-realtime-2.1-et és a gpt-realtime-2.1-mini-t. A modellek célja, hogy a hangalapú AI-ügynökök még természetesebben, kevesebb késleltetéssel beszélgessenek a felhasználókkal.
Mi az újdonság?
A legfontosabb fejlesztés a sebesség: a p95-ös késleltetés legalább 25 százalékkal csökkent az egész Realtime modellcsaládban, elsősorban a javított gyorsítótárazásnak köszönhetően. A gyakorlatban ez 250–500 ezredmásodperces válaszidőt jelent, amitől a beszélgetés úgy hat, mintha egy pillanatra elgondolkodó emberrel társalognánk.
A mini változat a gyorsabb, költséghatékonyabb megoldást keresőknek ajánlott, míg a nagyobb modell erősebb érveléssel, eszközhasználattal és utasításkövetéssel érkezik.
Testre szabható gondolkodás
A fejlesztők öt szintből választhatnak – minimal, low, medium, high és xhigh –, így egyensúlyozhatnak az egyszerű interakciók alacsony késleltetése és a bonyolultabb kérések alaposabb feldolgozása között. Az alapértelmezett szint a low.
Az új modellek az API-n keresztül érhetők el, és jól illeszkednek a gyorsan bővülő hangügynök-piac igényeihez.