Karin Verspoor
Las empresas de inteligencia artificial se basan en datos de la web para crear sus modelos. Los rastreadores llevan décadas siendo un elemento habitual en la forma en que empresas como Google y Microsoft recopilan datos para los motores de búsqueda. Acceden automáticamente a los sitios web a través de enlaces conocidos, extraen el contenido de cada página web —incluidos todos los enlaces de cada página para poder encontrar más páginas web— y los almacenan e indexan en una gran base de datos para que puedan recuperarse en respuesta a una consulta. Los desarrolladores de modelos de lenguaje grande (LLM) han aprovechado estas mismas estrategias para recopilar los datos utilizados para entrenar sus modelos.
Una parte importante de estos sistemas es lo que se conoce como el Protocolo de Exclusión de Robots, mediante el cual un sitio web puede indicar a un rastreador que no desea que se acceda a determinadas partes del sitio. En este caso, es muy probable que OpenAI haya ignorado cualquier restricción de este tipo establecida por los sitios web del Gobierno y simplemente haya recopilado todo aquello a lo que se pudiera acceder.
Los rastreadores modernos también pueden adivinar aleatoriamente enlaces a los que intentar acceder —generando URL plausibles a partir de URL conocidas mediante métodos muy similares a los que se utilizan en los propios LLM— y, de este modo, acceder a páginas que no son directamente visibles desde los sitios web de acceso público. El hecho de que los rastreadores pudieran acceder a archivos privados sugiere que es necesario revisar la configuración de seguridad de los sitios web para evitar el acceso no autorizado.