Ética & sociedad Reddit demanda a SerpApi por scraping y el caso avanza en tribunales
Un juez de EE.UU. permite que avance la demanda de Reddit contra el scraper SerpApi por presunta conspiración con Perplejidad. El caso, junto con el debate académico sobre si entrenar IA generativa es 'minería de datos', redefine los límites legales del web scraping. ¿Qué implica para las empresas latinoamericanas que dependen de datos abiertos?
La frontera entre el acceso abierto a la web y la protección de derechos de autor se está redefiniendo en los tribunales de Estados Unidos. Un juez federal acaba de dar luz verde a la demanda de Reddit contra SerpApi, un servicio de extracción de datos que, según la plataforma, conspiró con Perplejidad AI para scrapear contenido protegido de Reddit desde los resultados de búsqueda de Google. El caso, que aún está en etapas tempranas, plantea preguntas que resonarán con fuerza en toda América Latina: ¿quién controla realmente los datos que alimentan la inteligencia artificial?
El juez Paul A. Engelmayer, del Distrito Sur de Nueva York, consideró que Reddit ha presentado indicios plausibles de una conspiración: SerpApi habría ofrecido un producto para eludir los controles de acceso de Google, y Perplejidad AI lo habría pagado. El fallo llega apenas dos semanas después de que otro tribunal desestimara una demanda similar presentada por Google contra los mismos implicados. En aquella ocasión, el juez determinó que Google no había probado que los titulares de derechos —como Reddit— hubieran autorizado al buscador a impedir el raspado de contenido protegido. Google ya anunció que modificará su demanda para mantenerla viva.
Pero el verdadero debate de fondo no es técnico, sino legal y filosófico. Mientras Reddit y Google intentan utilizar la Digital Millennium Copyright Act (DMCA) como escudo, SerpApi sostiene que ambas compañías buscan "usar la DMCA para amurallar la Internet abierta, reclamando retroactivamente control sobre contenido que no escribieron ni poseen". Esta tensión entre propiedad intelectual y acceso a datos es el núcleo del caso.
Paralelamente, el mundo académico pone en duda la solidez de los argumentos legales de las empresas de IA. Un estudio interdisciplinario de 2024, publicado en arXiv por los investigadores Sebastian Stober y Tim W. Dornis, sostiene que el entrenamiento de modelos generativos de IA —como los que usa Perplejidad AI— no debería ampararse bajo las excepciones de "fair use" en EE.UU. ni bajo la excepción de "Text and Data Mining" (TDM) en Europa. La razón fundamental: el entrenamiento generativo no es minería de datos. Mientras que el TDM busca extraer información o patrones, los modelos generativos memorizan y reproducen, en ocasiones de forma casi literal, fragmentos de las obras con las que fueron entrenados.
El estudio señala que en la Unión Europea, la Directiva de Derechos de Autor en el Mercado Único Digital (DSM) permite la minería de datos para fines comerciales solo si el titular de derechos no se ha opuesto (por ejemplo, mediante un robots.txt). Sin embargo, Stober y Dornis argumentan que el entrenamiento de modelos generativos no encaja en esa excepción porque va más allá del análisis estadístico. En EE.UU., la doctrina del fair use exige un análisis caso por caso que difícilmente cubre la copia sistemática de millones de obras creativas para entrenar un modelo que luego compite con ellas.
¿Qué significa todo esto para las empresas latinoamericanas? La región carece de marcos legales específicos sobre scraping e IA. Países como Brasil, México y Chile debaten leyes de protección de datos que rozan el tema, pero aún no hay jurisprudencia clara sobre si entrenar un modelo con datos públicos de la web constituye una infracción. Mientras los tribunales de EE.UU. y Europa definen el estándar global, las startups y corporaciones latinoamericanas que dependen de datos abiertos para desarrollar sus productos de IA operan en una zona gris.
El riesgo es doble. Por un lado, una decisión adversa contra SerpApi podría sentar un precedente que endurezca el scraping a nivel global, encareciendo la obtención de datos para entrenar modelos. Por otro, si los tribunales terminan respaldando la postura de Reddit y Google, las empresas que hoy extraen datos de plataformas como Reddit, Twitter o LinkedIn sin autorización explícita podrían enfrentar demandas. Para los ejecutivos latinoamericanos, la lección es clara: la época del scraping sin control legal está llegando a su fin.
En este contexto, la trazabilidad de los datos se vuelve un imperativo estratégico. El paper de Stober y Dornis propone un sistema de documentación de fuentes de entrenamiento que equilibre los intereses de los titulares de derechos con las necesidades de los desarrolladores. Implementar registros de procedencia de datos no solo mitiga riesgos legales, sino que también genera confianza entre los usuarios y los inversores, cada vez más atentos a la legalidad de los datasets.
Queda en el aire una pregunta incómoda pero necesaria: ¿están las empresas de la región preparadas para demostrar de dónde sacaron cada uno de los datos que usaron para entrenar sus algoritmos? Porque si no lo están, los tribunales —más temprano que tarde— les obligarán a rendir cuentas.