El orden P-KD-Q triplica la compresión sin colapsar el modelo

Estudios revelan que combinar poda, cuantización y destilación no es aditivo: el orden P-KD-Q logra 3.68x compresión; cuantificar primero destruye el modelo. Claves para ejecutar IA en hardware limitado.

El orden P-KD-Q triplica la compresión sin colapsar el modelo

Foto: Vishnu Mohanan

La compresión de modelos de lenguaje deja de ser un menú de opciones independientes. Tres estudios recientes —uno empírico sobre interacciones híbridas, otro teórico sobre el orden óptimo y un tercero sistemático con Qwen2.5-3B— convergen en una misma advertencia: aplicar poda, cuantización y destilación en secuencia equivocada no degrada el rendimiento de forma aditiva, lo colapsa.

La trampa de la suma ingenua

Investigadores de AI Hub probaron combinar poda (eliminar pesos) y cuantización (reducir bits) en Falcon3-1B, LLaMA-3.2-1B y Qwen2.5-1.5B sobre una sola RTX 3080 Ti resultados. Si los efectos fueran aditivos, el modelo híbrido debería rendir igual que la suma de ambos por separado. No fue así: en TruthfulQA la verdad mejoró entre 7 y 14 puntos, pero en razonamiento (GSM8K) y conocimiento (MMLU) cayó 16 a 20 puntos más de lo esperado. La interacción entre técnicas reescribe el comportamiento del modelo de forma asimétrica por tarea.

Patrocinado Advertisement

La hipótesis de intensidad progresiva y el orden fatal

El paper aceptado en ICLR 2026 formaliza lo que los datos sugieren: las perturbaciones débiles deben preceder a las fuertes Progressive Intensity Hypothesis. Cuantizar temprano —antes de podar o destilar— vuelve al modelo inentrenable: la pérdida de información es irreversible y perjudica el entrenamiento posterior.

Un estudio sistemático en Qwen2.5-3B confirma la catástrofe AlphaXiv: seis permutaciones de tres técnicas, todas con 3.68x compresión final. Solo Poda → Destilación → Cuantización (P-KD-Q) preservó capacidades (G-Eval 0.733). Las secuencias con cuantización al inicio o en medio hundieron G-Eval a 0.06–0.14 y perplejidad a 24–53. La cuantización NF4 de 4 bits sola ya da 3x compresión con pérdida mínima; añadir poda y destilación antes de cuantizar recupera calidad, pero cuantizar primero quema la opción de refinar.

Optimización conjunta y hardware: de la teoría a la inferencia real

Dos propuestas llevan la lección al silicio. El framework TOGA (arXiv:2606.07819) co-optimiza poda estructurada y cuantización de precisión mixta via hiperredes que minimizan error global, no por capa paper. A 1–3 bits gana 21% perplexidad vs SoTA peso-activación y 59–85% vs peso-solo; en 4/8 bits entrega 2x prefill, 6.5x reducción de memoria pico y 30% inferencia más rápida que sparsity 2:4 semi-estructurada, con kernels CUDA propios para W4A4/W8A8.

DayPQ (IEEE TVLSI 2026) va más allá: poda dinámica por capa y cuantización FP8 con bias-shifting, co-diseñados con array multiplicador-free shift-add DayPQ.

Qué cambia para equipos en Latinoamérica

Un modelo de 3B en FP16 pesa ~6 GB; con P-KD-Q a 3.68x cabe en <2 GB dejando espacio para KV-cache y contexto largo. La lección operativa es una checklist de despliegue:

  • No cuantice antes de destilar ni podar. Si planea fine-tuning o KD, mantenga pesos en FP16/BF16 hasta el final.
  • Use poda estructurada, no no-estructurada. Solo la primera da matrices densas compatibles con cuBLAS y Tensor Cores; la sparsity 2:4 fija 50% y no escala a otras ratios.
  • Exija kernels de precisión mixta (W4A4/W8A8). Los 2x prefill y 6.5x memoria pico de TOGA o el 30% speedup real vs 2:4 no son teóricos: dependen de kernels que el proveedor del modelo o su equipo de MLOps deben integrar.
  • Mida por tarea, no solo perplexidad. La interacción poda+cuantización sube truthfulness pero hunde razonamiento; valide en sus benchmarks de negocio (SQL, clasificación, RAG) antes de comprimir en producción.

El siguiente cuello de botella no es la ratio de compresión —ya se acerca al límite de información— sino integrar estas decisiones de pipeline en CI/CD de modelos: versionar órdenes de compresión, auditar degradación por tarea y compilar kernels para el hardware objetivo. Quien trate la compresión como arquitectura de pipeline y no como checklist de técnicas, desplegará modelos útiles en el hardware que ya tiene.

Fuentes

  1. Cuando las técnicas de compresión no solo se suman: efectos de interacción en la compresión híbrida de LLM
  2. ¿Podar y luego cuantizar o cuantizar y luego podar? Comprender el impacto del orden de compresión en la compresión conjunta del modelo
  3. Podado estructural conjunto y cuantización de precisión mixta para la compresión de LLM
  4. Un Estudio Sistemático del Orden de Compresión para Grandes Modelos de ...
  5. DayPQ: Podado y cuantización dinámicos por capas para la aceleración de la inferencia de LLM
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.