Google DeepMind rediseña la forma en que la IA lee el contenido multimedia

Google DeepMind ha presentado una actualización de software que modifica por completo la manera en que la inteligencia artificial procesa los archivos multimedia. La empresa tecnológica implementa la comprensión de video agéntica en sus modelos de lenguaje más recientes, incluidos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite.

Esta tecnología reemplaza el procesamiento estático tradicional, donde el sistema analiza fotogramas fijos sin un propósito específico, y permite que la inteligencia artificial decida de forma activa qué segmentos de un video observar, a qué velocidad reproducirlos y si debe centrarse en la imagen, el audio o la transcripción. Para los desarrolladores y las empresas, este cambio es relevante porque optimiza el uso de recursos de forma notable. Al consumir únicamente los fragmentos necesarios, la herramienta logra reducir el consumo de tokens en hasta un 88% y recortar los costos de procesamiento en un 66%, al mismo tiempo que eleva la precisión de los análisis en un 7%. Este avance reduce las barreras económicas para crear aplicaciones comerciales que dependan del análisis de video de larga duración.

¿En qué consiste el análisis agéntico de video?

Para comprender el alcance de este avance, conviene revisar el método de análisis convencional. Hasta la fecha, cuando un modelo de lenguaje procesaba una grabación visual, recurría al procesamiento estático. Este método consiste en dividir el archivo en una secuencia rígida de imágenes, por lo general a un ritmo de 1 fotograma por segundo (1 FPS), y analizarlas consecutivamente. Dicha técnica obliga a asumir un alto gasto computacional o perder detalles críticos en grabaciones extensas, como conferencias de varias horas o grabaciones de seguridad.

La alternativa de Google DeepMind introduce un bucle agéntico. En lugar de procesar flujos masivos de imágenes de golpe, el modelo toma una postura activa y orientada a metas. La inteligencia artificial determina qué partes del video necesita inspeccionar, a qué velocidad reproducirlas y a través de qué formato (imagen, audio o transcripción de texto) debe buscar la respuesta. Si requiere un detalle sutil en un segundo concreto, utiliza una herramienta interna para cargar únicamente ese fragmento a alta resolución, obviando el resto.

Este sistema elimina la necesidad de escribir algoritmos complejos para segmentar el archivo de forma manual y enviarlo por partes al modelo. Ahora, el proceso se delega a la propia inteligencia artificial, que gestiona el flujo de trabajo de manera autónoma, reduciendo la complejidad de desarrollo.

Por qué importa este cambio y qué problemas resuelve

La adopción de este enfoque dinámico tiene consecuencias técnicas y económicas inmediatas. Al evitar el análisis innecesario de secuencias de video irrelevantes, la carga computacional se reduce de manera drástica. Los datos de rendimiento demuestran que las organizaciones logran reducir el consumo de tokens en hasta un 88% en comparación con los métodos tradicionales. Esta eficiencia se traduce de forma directa en un ahorro de costos de hasta el 66% en la factura de la interfaz de programación de aplicaciones (API).

En el plano técnico, la precisión del análisis mejora un 7%, ya que el modelo enfoca su capacidad de razonamiento en los datos correctos, evitando las distracciones de atención que provocan los contextos visuales demasiado grandes. Este equilibrio posiciona a Gemini 3.7 Flash en el punto óptimo entre calidad y costo. El nuevo sistema permite resolver con facilidad varias tareas que antes eran muy costosas:

  • Búsqueda de precisión milimétrica: Permite localizar cambios de estado o cortes de edición que duran fracciones de segundo, algo crucial para la edición automática de video.
  • Búsquedas eficientes de información específica: Facilita responder preguntas complejas en archivos de varias horas de duración sin consumir millones de tokens.
  • Detección precisa de anomalías: Permite reanalizar ventanas de tiempo sospechosas a una mayor velocidad de fotogramas para examinar movimientos rápidos o defectos visuales sutiles.
  • Recuento de acciones y objetos: Posibilita llevar un registro exacto de movimientos físicos repetitivos y objetos que aparecen rápidamente en la escena.

El contexto técnico y el equipo detrás de la investigación

Esta actualización ha sido diseñada y probada por los laboratorios de investigación de la multinacional tecnológica. El proyecto ha estado coliderado por Rohan Doshi, gerente principal de producto en Google DeepMind, y por Mario Lučić, director de investigación en la misma división de inteligencia artificial, coordinando sus esfuerzos con especialistas en visión computacional.

El desarrollo ha contado con aportaciones técnicas de investigadores como Sergi Caelles, Filip Pavetić, Ahmet Iscen y Suhas Yogin, del equipo de Visión Agéntica. Según detalla el comunicado oficial de Google DeepMind, esta nueva característica ya se encuentra operativa para su integración comercial y de desarrollo.

Los ingenieros pueden acceder a la documentación técnica mediante la guía oficial de desarrollo de Google AI Studio o la plataforma empresarial de la compañía. Su activación es muy sencilla, no requiere tarifas añadidas por características especiales y utiliza los precios estándar por token. Solo es necesario configurar el parámetro de procesamiento en modo agéntico.

Hacia una integración cotidiana de la inteligencia artificial

La hoja de ruta de la compañía contempla que estos beneficios se trasladen de forma progresiva a los consumidores finales. Google planea integrar el análisis agéntico de video directamente en su aplicación comercial Gemini para dispositivos móviles y de escritorio, lo que agilizará las consultas sobre archivos visuales propios de los usuarios.

Asimismo, en los próximos meses, esta capacidad se incorporará a su plataforma de video en continuo para mejorar la herramienta conocida como Ask YouTube. Este sistema permite a los internautas realizar preguntas complejas sobre el video que están viendo y obtener respuestas instantáneas basadas en lo que sucede en pantalla. Con este paso, la tecnología agéntica de análisis audiovisual pasa del plano conceptual a convertirse en una función práctica del día a día en la web.

NotebookLM
NotebookLMhttps://notebooklm.google/
En The AI Revolution News utilizamos NotebookLM para traducir y/o generar algunos textos a partir de fuentes oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias