El agregador de noticias reddit está haciendo ajustes en sus servidores para impedir que los robots puedan acceder al contenido de su plataforma. En mayo de este mismo año lanzaron un comunicado con el que expresaban su desacuerdo con la recopilación masiva de datos que están haciendo muchas entidades comerciales.
estas entidades perciben que no tienen limitaciones en el uso de esos datos y lo hacen sin tener en cuenta los derechos o la privacidad del usuario, ignorando solicitudes legales, de seguridad y de eliminación razonables del usuario.
Extracto del comunicado de reddit
Esta es la razón por la que han actualizado su Política de Contenido Público. Desde la plataforma han comenzado a implementar cambios en los archivos robots.txt de sus servidores para impedir el acceso a estos bots y scprits.
Scraping
El rastreo masivo, también conocido como scraping o web scraping, es una técnica que consiste en extraer información de sitios web de manera automática y masiva mediante bots o scripts. Se utiliza para recopilar miles o incluso millones de datos a través de la extracción de información de las páginas web.
En algunas ocasiones, estos datos son posteriormente utilizados para entrenar modelos de inteligencia artificial. Esto es lo que la compañía reddit no ve con buenos ojos ya que, entre otras cosas, estas entidades no pagan por el contenido con el que entrenan a sus productos comerciales.
La plataforma reddit ya restringía acceso a distintos actores localizados, como cualquier servidor, pero la llegada de la inteligencia artificial y de robots rastreadores de información mucho más sofisticados han llevado a la compañía a un bloqueo mayor para todos los que no hayan aceptado expresamente cumplir sus políticas de privacidad.
Excepciones en el bloqueo
Este bloqueo se realizará durante las próximas semanas y afectará al acceso de su contenido. Limitarán la velocidad y/o bloquearán a robots rastreadores de forma indiscriminada. Si es verdad que la actualización no debería afectar a sus usuarios y la plataforma ha incidido en que “Los actores de buena fe, como investigadores y organizaciones como Internet Archive, seguirán teniendo acceso al contenido de Reddit para uso no comercial”.
Internet Archive agradece que Reddit aprecie la importancia de ayudar a garantizar que los registros digitales de nuestros tiempos se archiven y conserven para que las generaciones futuras los disfruten y aprendan.
Mark Graham, director de Wayback Machine en Internet Archive.
reddit fue fundado por el desarrollador Steve Huffman y el emprendedor Alexis Ohanian en junio de 2005. La premisa original era crear un agregador de noticias donde los usuarios pudieran enviar enlaces y votar por el contenido que más les interesara. Inicialmente, reddit fue impulsado por la aceleradora de startups Y Combinator. A lo largo de los años, reddit se ha convertido en una plataforma social donde los usuarios pueden debatir en áreas de interés llamadas subreddits. Aunque su público es mayoritariamente anglosajón y la mayoría de la actividad se realiza en inglés, reddit ha dejado una huella significativa en la cultura de Internet.

