Pensar como humanos también es cosa de la IA

¿Pueden los modelos de lenguaje desarrollar una comprensión del mundo parecida a la humana? Un estudio liderado por el Instituto de Automatización de la Academia China de Ciencias apunta a que sí. Utilizando herramientas conductuales y de neuroimagen, el equipo examinó cómo modelos como ChatGPT-3.5 y Gemini Pro Vision organizan mentalmente 1.854 objetos naturales. ¿El hallazgo más relevante? Las representaciones que emergen en estos sistemas se alinean notablemente con la forma en que los humanos perciben y conceptualizan los objetos.

El estudio se publicó el pasado 9 de junio en Nature Machine Intelligence.

Embeddings con significado

Los investigadores aplicaron Sparse Positive Similarity Embedding (SPoSE) para analizar más de 4,7 millones de juicios de similitud en tareas del tipo odd-one-out, utilizadas en psicología cognitiva. Esta técnica permitió reducir la complejidad de los datos a 66 dimensiones interpretables, que capturan relaciones semánticas como “relación con animales”, “comida”, “tecnología” o “movimiento”.

Estas dimensiones no solo fueron estables y reproducibles, sino que además resultaron altamente predictivas: modelos como Gemini Pro Vision lograron una precisión del 63,4% en predicciones de elecciones humanas, acercándose al 64,1% obtenido por los propios humanos.

Categorías emergentes y cerebros alineados

Sin necesidad de instrucciones explícitas, los modelos clasificaron con precisión del 83,4% (LLM) y 78,3% (MLLM) los objetos en 18 categorías amplias como “vehículos”, “animales” o “herramientas”, demostrando que internalizan estructuras conceptuales similares a las humanas.

Además, comparaciones con datos de resonancia magnética funcional del Natural Scenes Dataset mostraron correlaciones significativas entre las representaciones de los modelos y la actividad en regiones cerebrales especializadas, como la área fusiforme de la cara (FFA), la corteza parahipocampal (PPA) y la área del cuerpo extrastriado (EBA).

¿Imaginan como nosotros?

Las dimensiones extraídas no son arbitrarias: reflejan rasgos visuales, semánticos y combinaciones de ambos. Mientras que los humanos usan más dimensiones visuales (color, forma), los modelos se apoyan en aspectos semánticos. No obstante, modelos multimodales como Gemini son capaces de captar propiedades espaciales o físicas de los objetos, mostrando una integración parcial de información visual.

Por ejemplo, objetos como «almendra» se representan a través de dimensiones relacionadas con la comida, mientras que «satélite» se asocia a tecnología y vuelo. En general, bastan entre 3 y 10 dimensiones para explicar la mayoría de decisiones, lo que demuestra la eficiencia de estos modelos al abstraer conceptos.

Más allá de las palabras: una IA más humana

Este estudio no solo tiene implicaciones teóricas en neurociencia cognitiva y psicología, sino también aplicaciones prácticas. Las representaciones descubiertas podrían mejorar la interacción humano-máquina, hacer más comprensibles los sistemas de IA y servir de base para modelos educativos o diagnósticos más precisos.

Además, al comparar estos modelos con redes neuronales tradicionales como VGG16 o SimCLR, los autores destacan que los LLMs y MLLMs presentan una organización semántica mucho más rica y alineada con el comportamiento humano.

Limitaciones y próximos pasos

El estudio se centró en ChatGPT-3.5 y Gemini Pro Vision 1.0, pero los autores señalan que la metodología es aplicable a modelos más recientes como GPT-4V. Futuras investigaciones podrían mejorar la alineación con humanos ajustando las instrucciones o utilizando anotaciones más específicas en los estímulos.

En definitiva, este trabajo demuestra que los modelos de lenguaje multimodal no solo procesan palabras o imágenes: están desarrollando una forma de “pensamiento” conceptual que, aunque diferente, se acerca cada vez más a la manera en que los humanos entienden el mundo.

Puedes consultar el paper completo en arXiv.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias