Los chatbots citan mal las fuentes en la mayoría de las ocasiones

Los buscadores con inteligencia artificial están ganando terreno como alternativa a Google. Casi uno de cada cuatro estadounidenses afirma haberlos utilizado. Sin embargo, un nuevo estudio publicado por el Tow Center for Digital Journalism de la Universidad de Columbia pone en duda su fiabilidad, especialmente cuando se trata de citar correctamente el contenido de los medios de comunicación.

El informe analiza el rendimiento de ocho motores de búsqueda generativos: ChatGPT Search, Perplexity y su versión Pro, DeepSeek Search, Copilot de Microsoft, Grok-2 y Grok-3 (ambos en beta) de xAI, y Gemini de Google. Los investigadores sometieron a estas herramientas a un test con 1600 preguntas, usando fragmentos reales de noticias de 20 medios distintos —algunos con acuerdos de licencia, otros que bloquean rastreadores mediante robots.txt—. La tarea era sencilla: identificar correctamente el titular, el medio original, la fecha y la URL del artículo.

Resultados alarmantes: más del 60 % de respuestas incorrectas

Los resultados fueron contundentes. Ninguno de los motores analizados se libró del suspenso. En total, más del 60 % de las respuestas fueron incorrectas o incompletas. Algunos como Grok 3 llegaron a fallar en el 94 % de los casos. ChatGPT ofreció 134 respuestas erróneas de las 200 pruebas a las que fue sometido, y sólo en 15 ocasiones expresó dudas o reconoció no tener certeza.

Peor aún, los modelos de pago ofrecieron más respuestas incorrectas con mayor seguridad que sus versiones gratuitas, generando una falsa sensación de confianza en los usuarios.

Ignorar el robots.txt: una amenaza para la autonomía editorial

Uno de los aspectos más preocupantes del estudio fue el hallazgo de que varias plataformas, como Perplexity y su versión Pro, accedieron a contenidos de medios que explícitamente les habían bloqueado en su archivo robots.txt. Por ejemplo, Perplexity Pro identificó correctamente un tercio de las noticias de National Geographic, a pesar de que su rastreador está bloqueado y no existe un acuerdo formal con dicho medio.

Esto sugiere que las plataformas están encontrando formas de obtener contenido restringido, ya sea a través de versiones sindicadas o mediante la omisión de directrices de exclusión. Una práctica que socava el control que los medios deberían tener sobre su contenido en la red.

Citas erróneas, enlaces rotos y versiones no oficiales

Otra tendencia recurrente fue la atribución errónea de contenidos. DeepSeek, por ejemplo, citó mal el medio de origen en 115 de 200 ocasiones. Además, los enlaces proporcionados solían ser incorrectos, llevaban a páginas rotas o apuntaban a versiones sindicadas como Yahoo News o AOL, incluso cuando el medio original tenía un acuerdo con la plataforma.

Grok 3 generó URLs inexistentes en 154 de los 200 casos. Gemini también presentó enlaces erróneos en más de la mitad de sus respuestas.

Este comportamiento no solo priva a los medios de tráfico web y posibles ingresos, sino que también compromete su reputación al asociar su marca con respuestas imprecisas o directamente erróneas.

Los acuerdos no garantizan mejores resultados

Aunque OpenAI y Perplexity han cerrado acuerdos de licencia con medios como The Guardian, Schibsted o Time, el estudio demuestra que estos convenios no mejoran sustancialmente la precisión de las respuestas. Por ejemplo, ChatGPT sólo identificó correctamente uno de los diez artículos de San Francisco Chronicle, pese a tener permiso de rastreo y un acuerdo con el grupo Hearst.

La voz del sector editorial

Danielle Coffey, presidenta de la News Media Alliance, resumió el malestar de los medios en una carta: “Sin la posibilidad de optar por no ser incluidos en un scraping masivo, no podemos monetizar nuestro contenido ni pagar a nuestros periodistas”.

Mark Howard, director de operaciones de Time, fue más optimista, destacando que la tecnología aún está en fase de madurez: “Hoy es el peor día que tendrá este producto. Con el tamaño de los equipos de ingeniería y la inversión en I+D, creo que seguirá mejorando”.

Conclusión

El informe deja claro que los buscadores con IA tienen un serio problema con las citas y la transparencia. No solo reproducen errores con gran seguridad, sino que muchas veces lo hacen desoyendo las preferencias de los medios, lo que plantea serias dudas éticas y económicas para el periodismo. A medida que estas herramientas ganen peso en la búsqueda de información, la presión sobre las plataformas para ofrecer resultados veraces, respetar los acuerdos editoriales y mejorar la transparencia será cada vez mayor.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias