AudioShake lanza Multi-Speaker 2.0 para separar voces superpuestas

La compañía AudioShake ha presentado Multi-Speaker 2.0, una actualización de su inteligencia artificial diseñada para separar a personas que hablan al mismo tiempo en grabaciones complejas. Lanzada el 1 de septiembre de 2026, esta tecnología combina la segmentación de diálogos con un aislamiento acústico capaz de extraer pistas limpias para cada participante, incluso en llamadas telefónicas de baja resolución o ruidosas.

Su importancia radica en la utilidad directa para la edición de pódcast, el doblaje ágil de contenidos y el entrenamiento de modelos de lenguaje dentro de la inteligencia artificial conversacional. Al procesar voces superpuestas de manera automática y sin perder información clave de los diálogos cruzados, esta herramienta optimiza la producción de medios eficientemente. Además, su capacidad para ofrecer puntuaciones de confianza detalladas permite a las empresas gestionar miles de horas de audio minimizando costos de supervisión humana. Esta solución técnica aspira a establecer un estándar de procesamiento automatizado muy necesario para agilizar proyectos a gran escala.

Aislamiento acústico de precisión: en qué consiste Multi-Speaker 2.0

Esta herramienta de AudioShake es un modelo acústico que separa un único archivo de audio con varios participantes en canales independientes para cada persona. A diferencia de los métodos de diarización tradicionales, que se limitan a identificar quién habla mediante metadatos, esta tecnología logra aislar la señal física de voz de cada persona. Esto permite que, incluso cuando varios interlocutores hablan a la vez, el sistema recupere ambas señales de audio de forma íntegra.

El sistema destaca por su simplicidad operativa: se basa en un modelo único que procesa grabaciones en cualquier resolución, desde llamadas telefónicas de soporte a 8 kHz hasta másteres profesionales a 48 kHz, sin requerir conversiones previas de formato. El resultado final se entrega en forma de stems (pistas de audio individuales e independientes) acompañadas de un archivo con marcas de tiempo estructuradas.

Por qué importa este avance en el procesamiento de voz

En una conversación cotidiana, las personas no hablan de manera estrictamente ordenada; los diálogos están llenos de risas, interrupciones y arranques simultáneos. Al procesar estos momentos con Multi-Speaker 2.0, se reduce drásticamente la pérdida de información en los sistemas de reconocimiento de voz automático o ASR. Cuando el audio contiene hasta un 20% de superposición de voces, la precisión de la transcripción de las pistas aisladas es idéntica a la que se obtendría si cada hablante usara un micrófono independiente.

En grabaciones ruidosas, el sistema consigue eliminar un 75% más ruido de fondo que su primera versión, y disminuye la filtración de voz (el llamado bleed en ingeniería de sonido) en un 32% respecto a la edición anterior. Este avance amplía notablemente las posibilidades en varios ámbitos clave:

  • Posproducción de medios: los editores de pódcast, radio y televisión pueden limpiar y nivelar voces individuales sin alterar el resto de la pista.
  • Entrenamiento de IA: permite procesar miles de horas de conversaciones reales con turnos de habla estructurados para entrenar modelos conversacionales.
  • Doblaje y traducción: facilita que los equipos de localización traduzcan y sustituyan las voces de forma individual.

Métricas de rendimiento frente a sistemas abiertos y comerciales

Detrás de este desarrollo se encuentra AudioShake, compañía especializada en la separación de sonido mediante inteligencia artificial. Para validar la eficacia de su nuevo modelo, realizaron una evaluación exhaustiva que midió la calidad del sonido y la utilidad del archivo resultante en sistemas de transcripción automáticos. La herramienta demostró su precisión al ser probada con Whisper large-v3, cometiendo hasta 4,1 veces menos errores de transcripción que el mejor separador de código abierto en pruebas de referencia.

Por otra parte, la tasa de error de asignación de locutores experimentó una reducción considerable. En pruebas realizadas sobre 14 bases de datos públicas, el modelo registró un 30% menos de errores de etiquetado frente a pyannote community-1. En grabaciones telefónicas, el escenario más difícil por su baja calidad, la mejora alcanzó un 38% frente a sus competidores directos. El rendimiento detallado de estas pruebas se puede consultar en el blog técnico de AudioShake.

Para facilitar el control de calidad en proyectos masivos, el sistema incluye de manera nativa dos puntuaciones de confianza generadas cada 20 milisegundos. El índice de confianza de asignación evalúa si la voz corresponde al participante correcto, mientras que la puntuación de separación mide la limpieza con la que se aisló la pista ante un solapamiento. Así, las organizaciones pueden procesar de forma automática los segmentos con puntuación alta y desviar únicamente las secciones dudosas a revisión humana.

¿Qué significa esto para el futuro del audio digital?

La evolución técnica representada en esta versión muestra cómo la inteligencia artificial avanza hacia el manejo de la imperfección de la comunicación humana. Aunque la precisión de la separación acústica empieza a mostrar degradación cuando la superposición de voces supera el umbral del 20%, el sistema demuestra que es viable procesar conversaciones reales sin imponer turnos artificiales a los hablantes. El desarrollo de modelos acústicos independientes del idioma permite que grabaciones telefónicas antiguas y audios con múltiples idiomas mezclados mantengan un alto nivel de inteligibilidad. En última instancia, la automatización del etiquetado y el aislamiento de voces facilita el tratamiento de datos de voz a gran escala.

NotebookLM
NotebookLMhttps://notebooklm.google/
En The AI Revolution News utilizamos NotebookLM para traducir y/o generar algunos textos a partir de fuentes oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias