---
title: "Compresión de prompts"
source: "https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts"
wiki: "systems-analysis.info/int"
article: "Compresión_de_prompts"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
  - "Category:Spanish"
revision_id: 1104
wiki_created_at: 2026-09-06T22:43:27Z
wiki_modified_at: 2026-09-06T22:43:27Z
downloaded_at: 2026-09-07T22:44:07Z
---

# Compresión de prompts

**Compresión de prompts** (del inglés *prompt compression*) es un conjunto de métodos en la ingeniería de prompts, dirigidos a reducir la longitud del texto de entrada (prompt) para los grandes modelos de lenguaje (LLM) preservando la información clave<sup>[\[1\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-jha2024-1)</sup>. Con el crecimiento de la ventana de contexto de los LLM a millones de tokens (por ejemplo, en Google Gemini), surgió la capacidad de procesar textos muy largos, pero esto creó nuevos desafíos: el alto costo de las llamadas, el aumento de la latencia y la disminución de la calidad del razonamiento debido al efecto de «pérdida en el medio»<sup>[\[2\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-survey2024-2)</sup>.

La compresión de prompts resuelve estos problemas al concentrar los datos más esenciales en una entrada reducida y descartar la información superflua. Esto reduce el riesgo de exceder el límite de contexto, acelera la generación y disminuye el costo, manteniendo al mismo tiempo la precisión de las respuestas<sup>[\[3\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-datacamp-guide-3)</sup>.

## Métodos de compresión de prompts

Los métodos de compresión de prompts se pueden dividir en varias clases principales.

### Eliminación de tokens (filtrado)

Este enfoque consiste en eliminar los tokens, frases u oraciones menos informativos del texto original sin alterar las partes restantes. La importancia de los tokens se determina heurísticamente.

- **LLMLingua**: Un método desarrollado por Microsoft que calcula la perplejidad de cada token y elimina aquellos que tienen poco impacto en la previsibilidad del texto. En la versión **LongLLMLingua**, este enfoque se adapta para documentos largos, teniendo en cuenta la relevancia de los fragmentos en relación con la consulta específica del usuario<sup>[\[4\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-jiang2023_llmlingua-4)</sup>.
- **Selective-Context**: Utiliza un modelo de lenguaje pequeño para evaluar la *autoinformación* (*self-information*) de cada token y descarta los tokens con la menor informatividad<sup>[\[5\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-li2023_selective-5)</sup>.
- **PCRL** (Prompt Compression via Reinforcement Learning): Entrena a un agente mediante aprendizaje por refuerzo para tomar una decisión para cada token —«mantener» o «eliminar»— con el objetivo de maximizar una métrica de calidad (por ejemplo, ROUGE) de la respuesta final<sup>[\[6\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-jung2023_pcrl-6)</sup>.

### Compresión abstractiva (resumen)

En este enfoque, un modelo compresor (generalmente de menor tamaño) genera un breve resumen abstracto del texto original, que luego se pasa al LLM principal.

- **RECOMP** (Retrieval-Compression-Prompting): Para cada documento en la base de conocimientos, se genera de antemano un resumen breve (*summary*) que tiene en cuenta las posibles consultas del usuario (*query-aware summary*). Esto permite no solo comprimir, sino también preprocesar la información<sup>[\[7\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-xu2024_recomp-7)</sup>.
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): Combina el entrenamiento de un modelo resumidor con el aprendizaje por refuerzo para generar resúmenes que mejoren al máximo la calidad de las respuestas del LLM principal<sup>[\[8\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-yang2023_prca-8)</sup>.
- **Prompt-SAW** (Semantic Aware Winnowing): Antes de resumir, extrae un grafo de conocimiento (entidades y relaciones) del texto, selecciona los nodos relevantes del grafo y genera un texto comprimido a partir de ellos<sup>[\[9\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-ali2024_promptsaw-9)</sup>.

### Compresión extractiva

Este método extrae fragmentos clave (oraciones, párrafos) del texto original sin parafrasearlos.

- **Reranker-LLMs**: Utiliza un modelo clasificador (*reranker*) que evalúa la importancia de cada párrafo o documento para la consulta actual y selecciona solo los más relevantes<sup>[\[10\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-pradeep2023_reranker-10)</sup>.
- **CompAct**: Demuestra una extracción-resumen iterativa. El modelo toma secuencialmente segmentos de un texto largo, los comprime y verifica si hay suficiente información para responder. Si no, añade el siguiente segmento y vuelve a comprimir, logrando una compresión significativa mientras se mantiene la calidad<sup>[\[11\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-yoon2024_compact-11)</sup>.

### Destilación y «tokens de memoria»

Una nueva clase de métodos donde, en lugar de texto, el modelo recibe tokens sustitutos o *embeddings* especialmente entrenados que contienen información comprimida.

- **Gist Tokens**: Un LLM es afinado para «condensar» instrucciones largas en un pequeño conjunto de *gist tokens* especiales (por ejemplo, 20-30 tokens en lugar de varios miles). Estos tokens se utilizan luego en lugar del prompt original, logrando una compresión de hasta 26 veces con una pérdida mínima de calidad<sup>[\[12\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-mu2023_gist-12)</sup>.
- **Soft Prompt Tuning**: En lugar de un prompt textual, se utilizan «tokens virtuales» entrenables (*embeddings*) que se ajustan para resolver una tarea específica.
- **SelfCP**: Propone utilizar el propio LLM congelado como compresor. Al alimentarle un segmento de texto con etiquetas especiales, el modelo genera una representación densa (*memory tokens*) que luego utiliza para responder<sup>[\[13\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-gao2024_selfcp-13)</sup>.

## Eficacia y compromisos

- **Aceleración y reducción de costos**: Dado que la complejidad de un transformador crece cuadráticamente (\$O(n^2)\$) con la longitud de la secuencia, reducir el prompt varias veces proporciona un ahorro significativo. Por ejemplo, los *gist tokens* con una compresión de 26 veces demuestran un ahorro de hasta el 40% en FLOPs<sup>[\[12\]](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_note-mu2023_gist-12)</sup>.
- **Aumento de la calidad**: A veces, la compresión de prompts puede incluso mejorar la calidad de las respuestas si el texto original contenía ruido o detalles que distraen. Eliminar el contexto irrelevante ayuda al modelo a centrarse mejor en los aspectos importantes de la tarea.
- **Compromiso en la calidad (*faithfulness*)**: Una compresión demasiado agresiva puede llevar a la pérdida de detalles importantes (fechas, nombres, negaciones), lo que empeorará la calidad de la respuesta. Los métodos abstractivos son especialmente propensos al riesgo de alucinaciones. Controlar la completitud y la fidelidad (*faithfulness*) del prompt comprimido es una tarea clave.

## Relación con otras áreas

- **Retrieval-Augmented Generation (RAG)**: RAG y la compresión de prompts están estrechamente relacionados. RAG puede considerarse una etapa externa de compresión: en lugar de procesar toda la base de datos, se buscan y seleccionan los documentos relevantes. La compresión de prompts complementa a RAG al reducir el volumen de los documentos ya seleccionados antes de pasarlos al LLM.
- **In-Context Learning**: Los ejemplos en contexto (demostraciones) aumentan significativamente la longitud del prompt. La compresión de estas demostraciones (por ejemplo, mediante *Instruction Distillation*, donde múltiples ejemplos se reemplazan por una única instrucción corta) es un área activa de investigación.

## Literatura

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. <a href="https://arxiv.org/abs/2403.00000" class="external text" rel="nofollow">arXiv:2403.00000</a>.
- Gao, J.; Cao, Z.; Li, W. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. <a href="https://arxiv.org/abs/2405.17052" class="external text" rel="nofollow">arXiv:2405.17052</a>.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. <a href="https://arxiv.org/abs/2310.05736" class="external text" rel="nofollow">arXiv:2310.05736</a>.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. <a href="https://arxiv.org/abs/2310.06839" class="external text" rel="nofollow">arXiv:2310.06839</a>.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. <a href="https://arxiv.org/abs/2308.08758" class="external text" rel="nofollow">arXiv:2308.08758</a>.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. <a href="https://arxiv.org/abs/2307.00000" class="external text" rel="nofollow">arXiv:2307.00000</a>.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. <a href="https://papers.nips.cc/paper_files/paper/2023/hash/3d77c6dcc7f143aa2154e7f4d5e22d68-Abstract-Conference.html" class="external text" rel="nofollow">NeurIPS 2023</a>.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. <a href="https://arxiv.org/abs/2310.04408" class="external text" rel="nofollow">arXiv:2310.04408</a>.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. <a href="https://arxiv.org/abs/2311.00000" class="external text" rel="nofollow">arXiv:2311.00000</a>.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. <a href="https://arxiv.org/abs/2402.00000" class="external text" rel="nofollow">arXiv:2402.00000</a>.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2404.01077" class="external text" rel="nofollow">arXiv:2404.01077</a>.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. <a href="https://arxiv.org/abs/2407.08892" class="external text" rel="nofollow">arXiv:2407.08892</a>.

## Referencias

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-jha2024_1-0) Jha, S., et al. (2024). «Characterizing Prompt Compression Methods for Long Context Inference». *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-survey2024_2-0) «Efficient Prompting Methods for Large Language Models: A Survey». *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-datacamp-guide_3-0) «Prompt Compression: A Guide With Python Examples». *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). «LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models». *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-li2023_selective_5-0) Li, M. (2023). «Compressing context to summarize and answer questions». *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). «Learning to Compress Prompts with Reinforcement Learning». *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). «RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation». *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). «PRCA: A new framework for prompt compression». *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). «Prompt-SAW: A new method for prompt compression». *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). «How to select the best passages for RAG?». *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). «CompAct: A new framework for interactive prompt compression». *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). «Learning to Compress Prompts with Gist Tokens». *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[4]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Compresi%C3%B3n_de_prompts#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). «SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself». *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[5]</a></span>
