Bots de IA saturan repositorios de Linux y GitHub

Scraping de bots satura repositorios, GitHub opta por opt-out y meta automatiza kernels. El costo de la IA en el desarrollo llega a las empresas de la región.

Bots de IA saturan repositorios de Linux y GitHub

Foto: Daniil Komov

La inteligencia artificial que ayuda a escribir software está generando una paradoja: los mismos repositorios de código que la alimentan ahora luchan contra ella. Linux, GitHub y Meta muestran, desde ángulos distintos, cómo la demanda de datos para entrenar modelos está redefiniendo las reglas del desarrollo, y las empresas latinoamericanas que dependen de código abierto deben tomar nota.

Bots de scraping que saturan Linux

Konstantin Ryabitsev, director de IT de la Fundación Linux, denunció que las herramientas de scraping impulsadas por IA están consumiendo más recursos que los desarrolladores humanos. El repositorio git.kernel.org recibe cerca de 6 millones de solicitudes diarias para acceder a commits, pero solo el 2 % proviene de usuarios reales. Aunque la fundación ha implementado filtros de tráfico, un tercio de los bots logra evadirlos, según publicó en la web oficial del kernel.

Patrocinado Advertisement

El motivo es estructural: modelos como Claude Code de Anthropic necesitan enormes volúmenes de código real para mejorar. El software de código abierto es la materia prima preferida, y los scrapers automáticos se encargan de extraerla. Para la infraestructura abierta, esta demanda silenciosa se convierte en un costo operativo creciente.

Meta lleva la automatización al extremo

En el otro extremo, Meta desarrolló KernelEvolve, un framework que usa agentes de IA para generar kernels optimizados para sus aceleradores heterogéneos. Según el paper presentado en ISCA 2026, el sistema logra un 100 % de éxito en los 250 problemas de KernelBench y reduce el tiempo de desarrollo de semanas a horas. Además, consigue mejoras de rendimiento de entre 1,25x y 17x en modelos de recomendación, LLMs y otros casos de producción.

Este enfoque muestra que la IA no solo consume código: también lo produce. Pero mientras Meta controla todo el pipeline internamente, las empresas externas dependen de plataformas ajenas como GitHub, donde las reglas están cambiando.

GitHub: su código alimentará a Microsoft si usted no actúa

El 25 de marzo de 2026, GitHub anunció que los datos de interacción de los usuarios de Copilot (planes Free, Pro y Pro+) se usarán para entrenar modelos de IA a partir del 24 de abril, salvo que el usuario lo desactive manualmente. Esto incluye sugerencias aceptadas, contexto de código, comentarios, nombres de archivos y estructura de repositorios. La política es de tipo opt-out: si no hace nada, ya está dentro, tal como detalla este análisis.

Este mecanismo legal se apoya en el "interés legítimo" del RGPD, la misma estrategia que Meta y LinkedIn usaron para entrenar modelos con datos de usuarios europeos. Sin embargo, las autoridades italianas multaron a OpenAI con 15 millones de euros en diciembre de 2024 por fallos en esta base legal, y la organización NOYB ha presentado denuncias contra Meta y X en múltiples jurisdicciones. La batalla legal está lejos de cerrarse.

Qué implica para las empresas de América Latina

Lo que se escribe con Copilot hoy puede terminar en un dataset corporativo de Microsoft, con consecuencias concretas para la región:

  • Confidencialidad de clientes: si usted desarrolla sistemas para empresas con cláusulas de propiedad intelectual, partes de ese código pueden ser expuestas al entrenamiento sin su consentimiento.
  • Cumplimiento normativo: las empresas de LATAM que operan con clientes europeos deben revisar si la transferencia de datos de código a GitHub cumple con el RGPD. Un mecanismo de opt-out incondicional podría no ser suficiente bajo estándares europeos.
  • Dependencia del open source: proyectos como WordPress o el propio kernel de Linux dependen de contribuciones voluntarias. Si los desarrolladores se ven obligados a elegir entre usar herramientas de IA o preservar su privacidad, el ritmo de innovación en el ecosistema abierto podría frenarse.

Esta tensión entre la IA que genera código y la infraestructura que lo aloja no es un problema técnico aislado. Es un desafío de gobernanza de datos que afecta decisiones tan básicas como elegir una herramienta de desarrollo o un proveedor de hosting. Las empresas que actúen ahora, desactivando el entrenamiento por defecto o estableciendo políticas internas claras, se adelantarán a una regulación que en la región apenas comienza a discutirse. Y las que esperen podrían descubrir que su ventaja competitiva ya fue absorbida por un modelo de otra compañía.

Fuentes

  1. Linux desactiva funciones anónimas ante el aumento de la inteligencia artificial
  2. Kernelevolve: Escalado de la codificación de kernel agente para aceleradores de IA heterogéneos en Meta
  3. GitHub va a usar tu código para entrenar la IA de Microsoft … si no ...
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.