Hugging Face publicó el 25 de agosto de 2026 un trabajo de MultiverseComputingCAI que presenta Quantization-Aware Healing (QAH), un método para recuperar capacidades en modelos de lenguaje que han sido sometidos tanto a compresión estructural como a cuantización. En una prueba con un GPT-OSS 120B reducido a 60.000 millones de parámetros y cuantizado a MXFP4, el modelo de 4 bits superó a su propia versión en bfloat16 en 7 de 9 benchmarks.
La compresión de un modelo suele eliminar capas, cabezas de atención o neuronas para reducir el número de parámetros. Después, la cuantización disminuye la precisión de los pesos, en este caso hasta representaciones de 4 bits. Ambas operaciones reducen el consumo de memoria y el coste de inferencia, pero también pueden deteriorar capacidades como el razonamiento, la resolución de problemas matemáticos y la generación de código.
Los procesos habituales incorporan una etapa posterior de recuperación, conocida como healing. Una de las técnicas más extendidas es quantization-aware training (QAT), que introduce operadores de falsa cuantización durante el entrenamiento y continúa ajustando el modelo mediante una función de pérdida basada en tareas. Según el artículo, este procedimiento obliga a repetir parte de un proceso de entrenamiento posterior que puede incluir supervised fine-tuning, RLHF y agentic tuning, además de operar con una representación de menor precisión.
Otra alternativa es quantization-aware distillation (QAD). En lugar de emplear una pérdida de tarea, QAD transfiere al modelo cuantizado el comportamiento de un modelo completo mediante una pérdida de divergencia KL aplicada a los logits. Este método funciona cuando el único cambio es la cuantización y existe una versión de precisión completa de la misma arquitectura. La situación cambia después de una compresión estructural: el modelo reducido ya no tiene un equivalente completo entrenado de forma independiente.
QAH modifica ese proceso utilizando como profesor el modelo original, anterior a la compresión, en lugar del checkpoint recuperado de la arquitectura reducida. El profesor mantiene el tamaño y la precisión originales, mientras que el estudiante tiene la mitad de parámetros y funciona en MXFP4. El método no requiere que ambos compartan arquitectura, ya que la transferencia se realiza mediante la distribución de salida del profesor. El estudiante recibe los logits del modelo original y se entrena con divergencia KL, sin utilizar etiquetas duras.
En la evaluación principal, el modelo de 60B en MXFP4 entrenado con QAH obtuvo 42,7 puntos en AA-LCR, frente a 35,3 de la versión de 60B en bfloat16, una diferencia de 7,4 puntos. En AIME 2025 alcanzó 76,3 frente a 70,7; en Aider, 40,9 frente a 38,2; en ?²-bench, 61,7 frente a 59,4; en GPQA Diamond, 67,4 frente a 65,7; en IFBench, 59,9 frente a 58,4; y en LiveCodeBench, 66,5 frente a 65,5.
El modelo QAH quedó por debajo de su versión bfloat16 en MMLU-Pro, con 73,8 frente a 74,0, y en SciCode, con 34,2 frente a 35,6. Los mayores avances aparecieron en las áreas que suelen verse más afectadas por la compresión: el razonamiento con contextos largos y las matemáticas.
La comparación también incluyó al profesor GPT-OSS 120B en MXFP4. Aunque el modelo QAH utiliza la mitad de sus parámetros y aproximadamente una cuarta parte de la memoria destinada a sus pesos, lo superó en LiveCodeBench, con 66,5 frente a 66,0. En GPQA Diamond quedó a 1,6 puntos, con 67,4 frente a 69,0. La mayor diferencia se registró en AA-LCR, un benchmark de contexto largo en el que la capacidad perdida por la compresión resulta más difícil de recuperar.
El artículo atribuye parte de la estabilidad del método a la propia función de pérdida. La divergencia KL mantiene al estudiante vinculado a una distribución fija del profesor, mientras que una pérdida de entropía cruzada continúa empujándolo hacia etiquetas duras incluso después de alcanzar un rendimiento elevado. Para trabajar con documentos de hasta 32.000 tokens, QAH reutiliza una pérdida KL segmentada que procesa la secuencia por partes y evita materializar al mismo tiempo toda la matriz de vocabulario y secuencia.
La información procede del artículo de Hugging Face «Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original», publicado por Antonio, Iker García-Ferrero, Ali Hashemi y Bakbergen Ryskulov de MultiverseComputingCAI: https://huggingface.co/blog/MultiverseComputingCAI/quantization-aware-healing.
Fuente: Hugging Face