OpenAI ha presentado su nuevo modelo de inteligencia artificial, GPT-4o, en un evento en directo el pasado lunes 13 de mayo. Esta nueva versión de ChatGPT es multimodal y aborda el problema de la latencia, permitiendo una interacción “en tiempo real”. La CTO de OpenAI, Mira Murati, mencionó que GPT-4o tiene una “inteligencia al nivel de GPT-4”, pero mejora en sus capacidades de texto, audio y visión en una única red neuronal. Aunque su rendimiento en texto y codificación es similar al de GPT-4 Turbo, GPT-4o destaca por su mejora significativa en idiomas no ingleses.
Respuesta inmediata
Una característica destacada es el nuevo modo de voz, que reduce la latencia a 320 milisegundos y permite una interacción más natural. Además, GPT-4o responde en diferentes tonos de voz, puede reír, cantar y resolver problemas matemáticos.
Otra novedad es la traducción instantánea, que permitirá conversar con ChatGPT en lenguaje natural y obtener respuestas traducidas en casi tiempo real. También mejorará en sus capacidades de visión, analizando fotos o capturas de pantalla.
Gratuito
GPT-4o se desplegará entre los usuarios de ChatGPT Plus y Team, y próximamente estará disponible para los usuarios gratuitos. Los usuarios de pago tendrán un límite más amplio para utilizar el nuevo modelo y acceso al modo de voz en tiempo real. Además, OpenAI lanzará una aplicación de ChatGPT para macOS.
En el siguiente vídeo podéis ver la presentación completa:
También podéis ampliar la noticia en la web oficial de Open AI: Hello GPT-4o | OpenAI
Es importante destacar que la rueda de prensa no abordó todas las novedades de ChatGPT 4o.
Se han implementado medidas de seguridad, y su evaluación muestra que no supera un riesgo medio en categorías como ciberseguridad, persuasión y autonomía del modelo. GPT-4o representa un paso importante hacia una interacción más natural entre humanos y computadoras.
En la fotografía de este artículo podemos ver a Mira Murati durante la presentación de ChatGPT 4o en un fotograma del directo de OpenAI.

