Los modelos de IA más confiables saben cuándo buscar ayuda

Akari Asai, premio AAAI 2025, demuestra que los modelos de lenguaje más confiables no son los más grandes, sino los que saben cuándo buscar información externa. Implicaciones para empresas en América Latina.

Los modelos de IA más confiables saben cuándo buscar ayuda

Foto: Takuya Hozumi

Imaginemos a un investigador chileno tratando de sintetizar los últimos avances en tratamiento oncológico. Abre el chat de turno, escribe su consulta y recibe una respuesta bien redactada. Pero al revisar las referencias descubre que dos de cada tres citas son inventadas. No es un error aislado: los modelos de lenguaje (LLMs) más populares alucinan entre el 78% y el 90% de las veces cuando deben apoyarse en fuentes reales, según datos del trabajo de Akari Asai, una investigadora que acaba de ganar el premio AAAI/ACM SIGAI a la mejor tesis doctoral de 2025 por su trabajo en modelos de lenguaje aumentados por recuperación de información (Retrieval-Augmented LMs).

Por qué no basta con hacer modelos más grandes

Durante años, la industria asumió que el camino para resolver las limitaciones de los LLMs –alucinaciones, conocimiento desactualizado, opacidad– era simplemente escalar: más datos, más parámetros, más poder de cómputo. La tesis de Asai, defendida en la Universidad de Washington y publicada en 2025, desafía esa creencia de manera frontal. Su investigación muestra que incluso modelos con cientos de miles de millones de parámetros siguen fallando al recuperar hechos de baja frecuencia o de cola larga (long-tail), esos datos que no aparecen cientos de veces en el entrenamiento pero que son vitales en contextos especializados.

Patrocinado Advertisement

La alternativa que propone es elegante en su sencillez: en lugar de obligar al modelo a memorizar todo, ¿por qué no enseñarle a buscar? Así nacieron los Retrieval-Augmented LMs (RALMs), sistemas que en el momento de la inferencia consultan bases de datos externas –papers, documentos corporativos, normativas locales– y generan respuestas a partir de evidencia recuperada, no de memoria interna.

De Self-RAG a OpenScholar: la evolución práctica

Asai no se limitó a la teoría. Su trabajo más conocido, Self-RAG, entrena al modelo para que decida autónomamente cuándo es necesario buscar información externa, cuándo puede responder con lo que ya sabe y cómo evaluar la calidad de sus propias respuestas. Este enfoque ya está integrado en bibliotecas populares como LlamaIndex y LangChain, usadas por miles de desarrolladores en todo el mundo.

El impacto más concreto llegó con OpenScholar, un sistema de código abierto diseñado para ayudar a científicos a sintetizar literatura académica. OpenScholar indexa 45 millones de artículos de acceso abierto, busca los pasajes relevantes y produce una respuesta con citas verificables. En evaluaciones con expertos, los investigadores prefirieron las respuestas de OpenScholar sobre las escritas por humanos el 51% de las veces. Y mientras GPT-4o alucinaba citas entre el 78% y el 90%, OpenScholar alcanzó una precisión de citas comparable a la de expertos humanos. El sistema ya ha sido usado por más de 30.000 investigadores y sus resultados fueron publicados en Nature en 2026.

Más recientemente, Asai y su equipo lanzaron DR Tulu, el primer modelo abierto entrenado específicamente para tareas de investigación profunda (deep research) mediante aprendizaje por refuerzo. Con solo 8 mil millones de parámetros, DR Tulu iguala o supera a sistemas propietarios como OpenAI Deep Research y Gemini en dominios de ciencia, salud y conocimiento general. Todo el código, los datos y los modelos se han liberado.

Lo que esto significa para América Latina

Para una empresa latinoamericana, estas innovaciones abren posibilidades concretas. Primero, el costo: los RALMs permiten que modelos más pequeños y económicos –como el DR Tulu de 8B– rindan al nivel de gigantes propietarios, siempre que tengan acceso a una base de datos adecuada. No es necesario invertir en el modelo más caro del mercado; basta con tener los datos correctos.

Segundo, el idioma. Los sistemas de recuperación pueden alimentarse con documentación local en español o portugués –normativas tributarias chilenas, jurisprudencia argentina, literatura médica brasileña– y generar respuestas precisas sin que el modelo de lenguaje haya sido entrenado específicamente con esos textos. Asai también ha trabajado en lenguas subrepresentadas (XORQA, AfriQA), demostrando que este enfoque funciona incluso donde los datos de entrenamiento escasean.

Tercero, la auditoría. Un RALM siempre puede mostrar la fuente de cada afirmación. Para sectores regulados como fintech, salud o energía –donde una alucinación puede traducirse en multas o daños reputacionales–, tener trazabilidad es un requisito no negociable.

El desafío de la adopción local

No es técnica la barrera: los componentes de un RALM –un modelo base abierto como Llama o Mistral, un motor de búsqueda vectorial y una base de documentos– están al alcance de cualquier equipo de datos. El verdadero desafío es la integración con fuentes locales de calidad. No sirve de nada tener el mejor motor de búsqueda si los documentos que indexa están desactualizados o no existen.

Aquí hay una oportunidad para startups latinoamericanas: construir y mantener repositorios verticales de información confiable –desde regulaciones hasta literatura técnica– y ofrecerlos como servicio a empresas que quieran implementar RALMs sin empezar desde cero. Es el mismo modelo de negocio que hizo crecer a proveedores de datos en otras industrias, pero aplicado a la era de la IA aumentada.

Según la tesis de Asai, la próxima frontera de la inteligencia artificial no está en el tamaño del modelo, sino en su capacidad para dialogar con el mundo real. Y para las empresas de la región, el diálogo ya empezó.

Fuentes

  1. Entrevista con Akari Asai – Más allá del escalado: Fronteras de los Modelos de Lenguaje Aumentados con Recuperación
  2. Más allá del escalado: Fronteras de los Modelos de Lenguaje Aumentados con Recuperación
  3. Akari Asai
  4. PDF AI Matters - 26 de julio Vol 11 Número 4
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.