PEFT (Parameter-Efficient Fine-Tuning) (ES)
Ajuste fino eficiente en parámetros (del inglés Parameter-Efficient Fine-Tuning, PEFT) es un conjunto de métodos para adaptar grandes modelos preentrenados, como los grandes modelos de lenguaje (LLM), a tareas específicas con un costo computacional y de recursos mínimo. A diferencia del ajuste fino completo (full fine-tuning) tradicional, que requiere la actualización de todos los parámetros del modelo, los métodos PEFT se centran en modificar solo una pequeña parte de los pesos (menos del 1-5% del total), dejando la mayor parte del modelo sin cambios («congelada»)[1].
Este enfoque permite reducir significativamente los requisitos de memoria, almacenamiento y tiempo de entrenamiento, haciendo que el proceso de adaptación de potentes modelos fundacionales sea más accesible y resistente al problema del olvido catastrófico[2].
Problemas del ajuste fino completo
El ajuste fino completo tradicional, en el que se actualizan todos los parámetros del modelo, enfrenta una serie de problemas críticos que han catalizado el desarrollo de PEFT:
- Altos costos computacionales: La actualización de cientos de miles de millones de parámetros requiere una enorme capacidad de cómputo (GPU/TPU de alto rendimiento) y una gran cantidad de memoria de video (VRAM), lo que encarece el proceso y lo hace inaccesible para muchos investigadores.
- Ineficiencia de almacenamiento: Para cada nueva tarea, es necesario almacenar una copia completa del modelo, que ocupa varios gigabytes, lo que provoca un crecimiento exponencial de los requisitos de espacio en disco.
- Olvido catastrófico (Catastrophic Forgetting): Al adaptarse a nuevos datos, el modelo "olvida" el conocimiento general adquirido durante el preentrenamiento, lo que disminuye su rendimiento en otras tareas.
- Riesgo de sobreajuste (Overfitting): En conjuntos de datos pequeños para el ajuste fino, los modelos con miles de millones de parámetros tienden a "memorizar" los ejemplos de entrenamiento en lugar de aprender patrones generalizables[2].
Taxonomía de los métodos PEFT
Los métodos PEFT se pueden clasificar según cómo modifican los parámetros del modelo. Existen tres categorías principales: aditivos, selectivos y de reparametrización[3].
Métodos aditivos
Estos métodos congelan todos los pesos originales del modelo y añaden nuevos módulos entrenables de pequeño tamaño.
- Adaptadores (Adapters): El método aditivo más antiguo. Se insertan pequeños módulos de redes neuronales con una arquitectura de «cuello de botella» entre las capas del transformador. Solo se entrenan los pesos de estos adaptadores[4].
- Métodos basados en prompts "suaves" (Soft Prompts): En lugar de modificar los pesos del modelo, estos métodos añaden vectores entrenables («tokens virtuales») a los datos de entrada, que guían el comportamiento del modelo. Las variantes clave son:
- Prompt Tuning: Añade vectores entrenables únicamente a los embeddings de entrada.
- Prefix-Tuning: Añade prefijos vectoriales entrenables a los estados ocultos en cada capa del mecanismo de atención, lo que proporciona un control más preciso[5].
- P-Tuning v2: Una generalización de la idea de Prefix-Tuning que aplica prompts entrenables en todas las capas del modelo, logrando un rendimiento comparable al del ajuste fino completo[6].
Métodos selectivos
Estos métodos no añaden nuevos parámetros, sino que seleccionan y ajustan un pequeño subconjunto de los ya existentes.
- BitFit: Un método extremadamente económico que solo ajusta los vectores de sesgo (bias terms) y los parámetros de las capas de normalización, actualizando menos del 0.1% del total de parámetros.
- Poda diferencial (Diff Pruning): Utiliza una máscara entrenable para determinar dinámicamente qué pesos deben actualizarse durante el entrenamiento[3].
Métodos de reparametrización
Esta categoría se basa en la hipótesis de que los cambios en los pesos para la adaptación del modelo tienen un bajo «rango intrínseco». En lugar de actualizar las matrices de pesos de rango completo, estos métodos actualizan su representación de bajo rango.
- LoRA (Low-Rank Adaptation): El método PEFT más popular en la actualidad. Supone que la actualización de la matriz de pesos `ΔW` puede aproximarse por el producto de dos matrices de bajo rango: `ΔW = BA`. Durante el ajuste fino, la matriz original `W` se congela, y solo se entrenan `A` y `B`[7].
- QLoRA: Combina LoRA con técnicas de cuantización para reducir aún más los requisitos de memoria, permitiendo el ajuste fino de modelos de 65 mil millones de parámetros en una única GPU de consumo[8].
Comparación de rendimiento y recursos
Los métodos PEFT permiten alcanzar un rendimiento comparable al del ajuste fino completo con una reducción radical de los costos.
| Modelo | Método | Parámetros entrenables (%) | Resultado en benchmark (Avg. Accuracy) | Fuente |
|---|---|---|---|---|
| BERT-Large | Ajuste fino completo | 100% | 80.4 (GLUE) | [4] |
| BERT-Large | Adapters | 3.6% | 80.0 (GLUE) | [4] |
| LLaMA-7B | LoRA | 0.83% | 74.7% | [9] |
| LLaMA-7B | DoRA (variante de LoRA) | 0.84% | 78.1% | [9] |
Las ventajas clave de PEFT en el ahorro de recursos son:
- Memoria de GPU (VRAM): Para el modelo LLaMA 65B, el ajuste fino completo requeriría teóricamente >780 GB de VRAM, mientras que QLoRA permite ajustarlo en una GPU con <48 GB de VRAM[8].
- Espacio de almacenamiento: Los checkpoints guardados después de PEFT ocupan megabytes en lugar de gigabytes. Esto permite almacenar cientos de «adaptadores» para diferentes tareas en el espacio que ocuparía un solo modelo completamente ajustado.
Áreas de aplicación
Desarrollados inicialmente para NLP, los métodos PEFT se han adaptado con éxito a una amplia gama de tareas:
- Visión por computadora (CV) y modelos multimodales (VLM): Adaptación de modelos como Vision Transformer (ViT) y Segment Anything Model (SAM) para tareas de segmentación de imágenes, incluso en biomedicina.
- Generación y análisis de código: Ajuste de LLM a las especificidades de proyectos de software concretos, API internas o bases de código.
- Modelos generativos: «Estilización» de modelos de generación de imágenes como Stable Diffusion mediante adaptadores LoRA (técnica Dreambooth).
- Síntesis de voz: Adaptación de modelos para generar voz con un timbre, entonación o color emocional específicos.
Enlaces externos
- Repositorio de la biblioteca PEFT en GitHub
- Documentación oficial de la biblioteca PEFT de Hugging Face
Bibliografía
- Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. arXiv:2305.14314.
- Houlsby, N. et al. (2019). Parameter-Efficient Transfer Learning for NLP. ICML 2019.
- Li, X.L.; Liang, P. (2021). Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190.
- Liu, X. et al. (2022). P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks. arXiv:2110.07602.
- Ben Zaken, E.; Ravfogel, S.; Goldberg, Y. (2021). BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-Based Masked Language Models. arXiv:2106.10199.
- Guo, D.; Rush, A.M.; Kim, Y. (2020). Parameter-Efficient Transfer Learning with Diff Pruning. arXiv:2012.07463.
- Jiang, Z. et al. (2024). MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning. arXiv:2405.12130.
- Mao, K. et al. (2024). A Survey on LoRA of Large Language Models. arXiv:2407.11046.
- Chen, S. et al. (2024). Parameter-Efficient Fine Tuning: A Comprehensive Analysis Across Applications. arXiv:2404.13506.
- Zhang, J. et al. (2025). Parameter-Efficient Fine-Tuning for Foundation Models. arXiv:2501.13787.
Referencias
- ↑ «Parameter-Efficient Fine-Tuning for Foundation Models». arXiv:2501.13787. [1]
- ↑ 2.0 2.1 «5 Problems Encountered Fine-Tuning LLMs with Solutions». Machine Learning Mastery. [2]
- ↑ 3.0 3.1 «PEFT: Parameter-Efficient Fine-Tuning Methods for LLMs». Hugging Face Blog. [3]
- ↑ 4.0 4.1 4.2 Houlsby, N., et al. «Parameter-Efficient Transfer Learning for NLP». Proceedings of the 36th International Conference on Machine Learning. [4]
- ↑ Li, X.L., Liang, P. «Prefix-Tuning: Optimizing Continuous Prompts for Generation». arXiv:2101.00190. [5]
- ↑ Liu, X., et al. «P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks». arXiv:2110.07602. [6]
- ↑ Hu, E.J., et al. «LoRA: Low-Rank Adaptation of Large Language Models». arXiv:2106.09685. [7]
- ↑ 8.0 8.1 Dettmers, T., et al. «QLoRA: Efficient Finetuning of Quantized LLMs». arXiv:2305.14314. [8]
- ↑ 9.0 9.1 «Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications». arXiv:2404.13506. [9]