Wikidata abre su base de datos a la IA

Wikimedia Deutschland ha lanzado el Wikidata Embedding Project, una innovadora base de datos vectorial que traduce los datos estructurados de Wikidata en vectores, permitiendo a los modelos de inteligencia artificial explorar y comprender mejor los 119 millones de datos almacenados en la plataforma.

El proyecto tiene como objetivo hacer que los sistemas de IA puedan interpretar las relaciones semánticas entre los distintos elementos de Wikidata, reforzando así el acceso abierto a la información estructurada que sustenta Wikipedia y otros proyectos del ecosistema Wikimedia.

Una base de datos diseñada para la IA

El sistema convierte los datos estructurados en vectores dentro de un espacio que representa relaciones complejas entre conceptos. De esta forma, los modelos de lenguaje podrán interpretar semánticamente la información a través del Model Context Protocol (MCP), un estándar que facilita la integración de datos externos en sistemas de IA generativa.

Hasta ahora, la búsqueda en Wikidata dependía del motor Cirrus Search, basado en coincidencias de palabras clave. Este enfoque resulta insuficiente para los modelos generativos que utilizan Retrieval Augmented Generation (RAG), técnica que combina el conocimiento interno de un modelo con datos verificados y actualizados en tiempo real.

Colaboración abierta y visualización avanzada

El nuevo sistema, ya disponible, permite identificar con mayor precisión conceptos ambiguos y visualizar resultados en 2D y 3D mediante agrupaciones de significado (meaning clusters). Además, integra un módulo de reajuste (reranker) que mejora la relevancia de las búsquedas.

La iniciativa ha sido liderada por Wikimedia Deutschland con la colaboración de Jina AI, empresa berlinesa especializada en búsqueda semántica, y Data Strax, filial de IBM dedicada a bases de datos optimizadas para IA. Actualmente, el sistema permite búsquedas en inglés, francés y árabe, con planes de incorporar español y mandarín antes de finales de 2025.

Hacia una IA más transparente

El objetivo de Wikimedia es ofrecer una infraestructura abierta que sirva como alternativa a las plataformas de Big Tech.

Queremos crear una infraestructura que permita a cualquiera desarrollar aplicaciones de IA generativa basadas en datos verificables, libres y abiertos.

Lydia Pintscher, responsable del portafolio de Wikidata en Wikimedia Deutschland

El sistema combina varios modelos de aprendizaje automático con una base de datos vectorial escalable dentro de un entorno containerizado. Aunque los servicios de Jina AI y Data Strax no son completamente abiertos, el código fuente principal se ha publicado bajo licencia MIT, permitiendo su uso y adaptación por la comunidad.

Un impulso para la comunidad open source

Wikimedia espera que esta herramienta fomente el desarrollo de aplicaciones de IA centradas en la verificación de hechos y la lucha contra el vandalismo digital. Además, refuerza el papel de Wikidata como repositorio universal de datos estructurados para proyectos como Wikipedia, Wikivoyage o Wiktionary.

En el futuro, el proyecto aspira a inspirar nuevas iniciativas de código abierto capaces de competir con soluciones propietarias, promoviendo una inteligencia artificial más transparente, colaborativa y accesible para todos.

La fotografía de representación de este artículo pertenece a Adrien y ha sido publicada en Unsplash

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias