etiqueta: modelos multimodales

00:27:04

AlphaGenome y el futuro del diagnóstico genético

AlphaGenome, el nuevo modelo de Google DeepMind, representa un salto en la comprensión del genoma humano. Esta red neuronal es capaz de predecir cómo afecta cualquier variante genética a funciones como la expresión génica, el empalme del ARN o la accesibilidad del ADN en células humanas y de ratón. A diferencia de modelos anteriores, AlphaGenome unifica en una sola herramienta predicciones multimodales, resolución a nivel de nucleótido y un contexto de hasta un millón de bases de ADN. Entrenado sobre datos del genoma humano y murino, el modelo supera a sus competidores en casi todas las tareas y ofrece un acceso abierto para la comunidad científica. Su potencia predice incluso mutaciones implicadas en enfermedades como la leucemia, abriendo nuevas vías para el diagnóstico genético y el diseño de terapias personalizadas.

La IA se repite: la creatividad artificial tiene límites

Un nuevo estudio titulado *“Autonomous language-image generation loops converge to generic visual motifs”*, publicado el 9 de enero de 2026 en la revista científica Patterns (Elsevier), ha demostrado que los sistemas de inteligencia artificial que generan y describen imágenes sin intervención humana tienden a producir resultados cada vez más similares. El trabajo, liderado por el investigador Arend Hintze desde la Universidad de Dalarna (Suecia) y la Universidad Estatal de Míchigan (EE.UU.), analiza más de 700 ciclos entre modelos de texto e imagen y concluye que las IA acaban generando lo que los autores denominan “música de ascensor visual”: imágenes genéricas y de estética comercial.

Kling presenta vídeo con sonido nativo y edición avanzada por texto

Kling lanza el modelo VIDEO 2.6 con audio integrado y VIDEO O1, capaz de editar escenas y transformar planos con un simple texto.

Pensar como humanos también es cosa de la IA

Un equipo internacional de investigadores ha revelado que los grandes modelos de lenguaje, como ChatGPT y Gemini, desarrollan representaciones conceptuales de objetos sorprendentemente parecidas a las de los humanos. Analizando 4,7 millones de juicios de similitud entre objetos, descubrieron que estas inteligencias artificiales no solo organizan objetos de forma coherente, sino que incluso reflejan patrones de actividad cerebral humana.

Llama 4, el nuevo gigante de Meta: más inteligente, abierto y multimodal

Meta lanza Llama 4 Scout y Llama 4 Maverick, dos modelos de lenguaje multimodal con peso abierto que marcan un salto cualitativo en rendimiento, eficiencia y versatilidad. Ambos están disponibles desde hoy en Hugging Face y llama.com, y ya funcionan en aplicaciones como WhatsApp e Instagram. Junto a ellos, Meta ha presentado Llama 4 Behemoth, un modelo de 2 billones de parámetros que aún se encuentra en entrenamiento y que ha servido como maestro para los nuevos modelos.

Gemini se vuelve reflexivo

Google lanza Gemini 2.5, una IA diseñada para razonar antes de generar respuestas, marcando un salto cualitativo respecto a modelos anteriores. Con una capacidad de contexto de hasta 2 millones de tokens y funciones multimodales, el modelo ya lidera benchmarks clave como LMArena y destaca en tareas complejas de codificación y razonamiento. Disponible en AI Studio y Gemini Advanced, es la base de los futuros agentes autónomos de Google. Este enfoque se apoya en técnicas como el aprendizaje por refuerzo y las estrategias de chain-of-thought, junto con una mejora significativa en la arquitectura del modelo base.

lo + leído