Inworld lanza Realtime TTS-2, la IA de voz que entiende emociones

Inworld AI ha presentado Realtime TTS-2, una nueva generación de modelos de voz diseñada específicamente para la conversación en tiempo real. A diferencia de los sistemas tradicionales que se limitan a leer texto, esta tecnología tiene la capacidad de escuchar el audio previo del intercambio para captar el tono, el ritmo y el estado emocional de la persona con la que habla.

Esta conciencia conversacional permite que la respuesta de la inteligencia artificial no solo sea coherente en el contenido, sino también en la forma, ajustando su entrega según el contexto de la charla. El modelo, que ya está disponible en fase de previsualización para investigación, permite a los desarrolladores dirigir la voz mediante instrucciones en lenguaje natural, del mismo modo que se haría con un actor humano. Con una latencia inferior a los 200 milisegundos y soporte para más de 100 idiomas, Realtime TTS-2 busca reducir la distancia entre la interacción robótica y la naturalidad humana. Este avance es especialmente relevante para sectores como los videojuegos, la educación de idiomas y la atención al cliente, donde la conexión emocional y la fluidez son pilares fundamentales para una experiencia de usuario satisfactoria y creíble.

¿Qué es Realtime TTS-2 y cómo funciona?

Realtime TTS-2 representa una evolución técnica significativa respecto a su predecesor, el modelo 1.5, que ya ocupaba posiciones destacadas en las comparativas de la industria. La principal diferencia radica en que este nuevo motor no se limita a procesar una frase aislada, sino que comprende el contexto sonoro completo de una conversación. El sistema escucha cómo suena el usuario (su cansancio, su entusiasmo o su frustración) y utiliza esa información para decidir cómo debe responder vocalmente. Esta capacidad se denomina conciencia conversacional y permite que la voz de la IA se sienta más como una persona que presta atención que como un programa leyendo un guion.

Para lograr esta naturalidad, el modelo introduce la Dirección de Voz mediante lenguaje sencillo. Los desarrolladores ya no dependen de una lista cerrada de emociones predefinidas, sino que pueden escribir descripciones detalladas como instrucciones de escena. Por ejemplo, se puede pedir a la IA que hable de forma susurrada o con un tono cansado pero cálido, y el modelo adaptará su interpretación automáticamente. Además, se han integrado marcadores no verbales que incluyen risas, suspiros y respiraciones en puntos específicos del texto. Estas señales no se pronuncian como palabras, sino que se generan como sonidos naturales que dan realismo a la interacción.

Otro componente técnico clave son las disfluencias, que son esas pequeñas imperfecciones del habla humana como los «eh» o «mmm». El modelo es capaz de colocar estas pausas de manera estratégica para simular que está pensando o recordando algo, lo cual evita la sensación de una respuesta robótica inmediata y perfecta. Estas características trabajan en conjunto bajo una latencia de menos de 200 milisegundos para el primer fragmento de audio, lo que garantiza que la conversación no sufra retrasos incómodos para los participantes.

La importancia de una voz que escucha

La capacidad de mantener una identidad de voz única en más de 100 idiomas es uno de los cambios más prácticos para las empresas globales. Hasta ahora, muchas soluciones requerían gestionar una biblioteca de voces distinta para cada idioma, lo que rompía la consistencia del personaje o del asistente virtual. Con Realtime TTS-2, un mismo agente puede cambiar de inglés a español o japonés en medio de una frase sin perder su timbre original. Esto es vital para aplicaciones educativas donde la fluidez entre idiomas es una parte esencial del aprendizaje.

Para las empresas que buscan una personalización total, el sistema ofrece el Diseño Avanzado de Voz. Esta herramienta permite crear una voz nueva a partir de una descripción escrita, sin necesidad de grabaciones de referencia ni de contratar actores de doblaje. Un desarrollador puede describir a un narrador anciano y distinguido o a una instructora de meditación calmada, y el sistema generará una voz reutilizable en segundos. Para casos donde ya existe una voz de marca, el servicio permite el clonado de voz mediante una muestra de audio de pocos segundos, manteniendo una alta fidelidad.

Las aplicaciones prácticas de esta tecnología son variadas y ya están siendo probadas por diversos socios:

  • Videojuegos nativos de IA: permite crear personajes con los que los jugadores pueden conectar profundamente gracias a su complejidad emocional.
  • Atención al cliente inteligente: el modelo detecta si un cliente está molesto y puede bajar la energía de su voz para calmar la situación de forma empática.
  • Educación personalizada: facilita la creación de tutores que se adaptan al ritmo y estado de ánimo del estudiante en múltiples idiomas.
  • Asistentes de productividad: proporciona herramientas de voz que resultan menos agotadoras durante interacciones largas gracias a su ritmo natural.

Quién está detrás y datos del proyecto

Inworld AI es la empresa responsable de este desarrollo y ha logrado posicionar su tecnología en el primer lugar de la Arena de Discurso de Artificial Analysis. Su enfoque se centra en lo que ellos llaman el flujo de tres etapas: Escucha, Pensamiento y Expresión. El sistema utiliza un reconocedor de voz que perfila al hablante en tiempo real (edad, acento, tono emocional), un enrutador inteligente que elige el mejor modelo de respuesta y, finalmente, el motor TTS-2 que genera el audio final. Todo este proceso ocurre en una única conexión persistente para evitar la pérdida de matices que sucede al usar proveedores diferentes para cada tarea.

El director científico de la compañía, Igor Poletaev, destaca que la mayoría de los modelos de voz generan audio de forma aislada, mientras que su sistema utiliza el audio de todo el intercambio para ajustar cómo habla la máquina. Por su parte, el CEO Kylan Gibbs subraya que el objetivo es cómo se siente la voz, no solo cómo suena. Actualmente, el modelo está disponible a través de la API de Inworld y cuenta con integraciones en plataformas como Cloudflare, LiveKit y Stream. Los usuarios actuales de versiones anteriores pueden actualizar sus sistemas simplemente cambiando el identificador del modelo en su código.

¿Qué significa esto para el futuro?

La llegada de modelos como Realtime TTS-2 sugiere una tendencia clara hacia una inteligencia artificial más empática y menos rígida. Al permitir que el software entienda los matices del habla humana y responda con una expresividad similar, se abren nuevas posibilidades para la narrativa interactiva y la asistencia digital. La capacidad de elegir entre diferentes modos de estabilidad (Expresivo, Equilibrado o Estable) también indica que la industria está madurando para ofrecer soluciones que se adaptan tanto al entretenimiento creativo como a entornos profesionales donde la consistencia es crítica. Aunque todavía se encuentra en fase de prueba, la reducción de la brecha entre la voz artificial y la humana parece estar avanzando hacia un punto donde la tecnología se vuelve, por fin, invisible.

NotebookLM
NotebookLMhttps://notebooklm.google/
En The AI Revolution News utilizamos NotebookLM para traducir y/o generar algunos textos a partir de fuentes oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias