---
title: "PromptRobust (benchmark) (ES)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 5936
wiki_created_at: 2026-09-06T23:56:06Z
wiki_modified_at: 2026-09-06T23:56:06Z
downloaded_at: 2026-09-07T23:11:07Z
---

# PromptRobust (benchmark) (ES)

**PromptRobust** (también conocido como **PromptBench**) es un **benchmark** integral para evaluar la robustez de los modelos de lenguaje grandes (LLM) frente a **alteraciones adversarias del prompt**, es decir, pequeñas distorsiones en la formulación de la tarea que no alteran su significado<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. El benchmark fue desarrollado en 2023 por un grupo de investigadores (Kaijie Zhu et al.) de Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. La creación de PromptRobust se debe a la observación de que los LLM modernos son sensibles a los detalles de la formulación: incluso cambios menores (por ejemplo, errores tipográficos o paráfrasis) pueden afectar notablemente las respuestas de los modelos<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. El benchmark tiene como objetivo medir cuantitativamente esta vulnerabilidad y fomentar el desarrollo de métodos de interacción más fiables con los LLM.

## Metodología de evaluación

En el marco de la investigación de PromptBench, se creó un corpus de **4788 prompts modificados** que conservan el significado original de las tareas<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-abs-3)</sup>. Estos prompts adversarios se generaron en cuatro niveles de complejidad de alteración<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>:

- **Nivel de carácter**: Introducción de errores tipográficos, sustitución o permutación de caracteres (simulando errores de entrada accidentales).
- **Nivel de palabra**: Sustitución de algunas palabras por sinónimos, introducción de palabras "ruido" u otros cambios léxicos menores.
- **Nivel de oración**: Parafraseo de la estructura de las oraciones, adición o reordenamiento de partes de una frase sin cambiar el tema general.
- **Nivel semántico**: Reformulación más profunda del prompt conservando su tarea (por ejemplo, formulaciones alternativas de la misma pregunta)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>.

El objetivo de tales "ataques" es verificar cómo desviaciones menores (por ejemplo, errores tipográficos accidentales o el uso de formulaciones sinónimas) afectan la capacidad del modelo para realizar correctamente la tarea, dado que la tarea en sí no ha cambiado<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Cada prompt adversario generado se aplicó a una serie de tareas estándar de NLP, incluyendo **análisis de sentimientos**, **identificación de corrección gramatical**, **detección de oraciones duplicadas**, **inferencia lógica** (NLI), **comprensión lectora**, **traducción automática** y **resolución de problemas matemáticos**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Para los experimentos, se seleccionaron 8 tipos diferentes de tareas en 13 conjuntos de datos, desde los conjuntos clásicos de GLUE (por ejemplo, SST-2 para análisis de sentimientos, MNLI para NLI) hasta pruebas matemáticas y multilingües especializadas<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>.

Es importante destacar que se evaluó la robustez de diferentes **formatos de prompt**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>:

- Prompts directos sin ejemplos (**zero-shot**, solo la instrucción).
- Prompts con varios ejemplos (**few-shot**, donde el prompt incluye muestras de la solución).
- Prompts de rol (**in-context roles**, por ejemplo, "Usted es un sistema de análisis de sentimientos, determine...").
- Prompts orientados a la tarea (**task-oriented**, una descripción directa de la tarea)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>.

También se probaron varios modelos de lenguaje a gran escala, desde el relativamente pequeño Flan-T5-large y el modelo UL2 hasta los avanzados ChatGPT y GPT-4, así como los modelos abiertos de la familia LLaMA 2 y su derivado Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Para generar los ataques se utilizaron métodos existentes del campo del NLP adversario (como TextBugger, DeepWordBug, TextFooler, etc.), adaptados para modificar los prompts en lugar de los datos de entrada<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. La corrección de los prompts "distorsionados" obtenidos se verificó mediante métodos automáticos y manuales; según el informe, al menos el 85% de las variaciones adversarias conservan la semántica correcta y son comprensibles para un humano<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Por lo tanto, el impacto de los ataques refleja fallos del modelo en la percepción de la tarea parafraseada, y no la pérdida del significado de la tarea en sí.

## Resultados y conclusiones

Las pruebas demostraron que los LLM modernos **no son lo suficientemente robustos ante pequeños cambios en la formulación del prompt**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-abs-3)</sup>. En todos los modelos probados, se observó una disminución significativa en la calidad de las respuestas bajo la influencia de los ataques generados<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-abs-3)</sup>. En particular, incluso casos simples —como un error tipográfico en el enunciado de un problema matemático o la sustitución de una palabra clave por su sinónimo— provocaban que el modelo diera un resultado incorrecto, aunque lo resolvía correctamente sin la distorsión<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. La conclusión general de los autores es que "los modelos de lenguaje grandes modernos **no son robustos** (resistentes) a los prompts adversarios"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-abs-3)</sup>, lo que significa que desviaciones menores en el *phrasing* (la formulación) pueden inducirlos sistemáticamente a error.

Al analizar los diferentes tipos de ataques, se descubrió que los cambios a **nivel de palabra** son los que tienen un efecto más destructivo en el rendimiento de los LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. La sustitución de palabras por sinónimos o una ligera distorsión morfológica provocaron la **mayor caída en la calidad**, con un promedio de ≈33% en comparación con el resultado original en las mismas tareas<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Los ataques a **nivel de carácter** (errores tipográficos, caracteres aleatorios) causaron una disminución promedio de la precisión de ~20%<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Por el contrario, la alteración cualitativa o la adición de oraciones completas al prompt tuvieron un efecto mucho más débil, casi sin confundir al modelo<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Las **paráfrasis semánticas** (una reformulación profunda del prompt de otra manera) resultaron ser comparables en su efecto perjudicial a los simples errores tipográficos<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Estos hechos subrayan que los LLM son especialmente vulnerables a cambios léxicos sutiles y errores en palabras clave<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Es revelador que las distorsiones gramaticales (errores tipográficos) teóricamente pueden filtrarse con correctores ortográficos estándar, mientras que los cambios a nivel de palabra y de significado requieren una comprensión semántica avanzada que a los modelos actuales a menudo les falta<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>.

El análisis del rendimiento de diferentes modelos mostró una dispersión significativa en su robustez<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. **GPT-4** y **UL2** demostraron la mejor resistencia a los prompts adversarios<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. El modelo Flan-T5-large y el modelo conversacional ChatGPT también resultaron ser un poco menos susceptibles a fallos<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Los modelos de la familia LLaMA 2 se situaron en una posición intermedia, mientras que **Vicuna** (13B) se destacó como el más vulnerable a todos los tipos de ataques<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Curiosamente, **el tamaño del modelo no resultó ser un factor decisivo para la robustez**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>: el relativamente pequeño T5-large fue casi tan estable en sus respuestas como el mucho más grande ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Los autores sugieren que los **métodos de entrenamiento y ajuste fino** (fine-tuning) de los modelos juegan un papel clave, y no solo su escala<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Por ejemplo, UL2 y T5-large se sometieron a un pre-entrenamiento extendido en grandes corpus de datos, y ChatGPT fue entrenado con aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF), lo que podría haber fortalecido su robustez<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Por el contrario, Vicuna fue entrenado en un conjunto de datos comparativamente limitado (como una réplica de código abierto), lo que probablemente explica su alta sensibilidad a los cambios en la formulación<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Estos resultados indican que mejorar los métodos de *fine-tuning* puede aumentar la fiabilidad de los modelos más que simplemente aumentar su tamaño.

### Influencia del formato del prompt

La forma en que se presenta el prompt también afecta la fiabilidad de la respuesta<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Se encontró que los **prompts con ejemplos (few-shot) aumentan significativamente la robustez** del modelo en comparación con las instrucciones de un solo paso sin ejemplos (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. La presencia de varios ejemplos demostrativos de la tarea en el prompt ayuda al modelo a interpretar la tarea con mayor precisión, incluso en presencia de alteraciones de "ruido". Los prompts de rol y los orientados a la tarea (task-oriented) mostraron un nivel de robustez comparable en general, aunque su efectividad varió de una tarea a otra<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Por ejemplo, en los datos de análisis de sentimientos y detección de oraciones duplicadas, el formato de rol fue ligeramente más fiable, mientras que en las tareas de comprensión lectora y traducción, las instrucciones explícitas de la tarea funcionaron mejor<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Estas observaciones pueden servir como guía para el diseño de prompts: agregar ejemplos detallados y contexto de rol reduce la probabilidad de que el modelo cometa errores con formulaciones no estándar.

### Transferibilidad de los ataques entre modelos

La transferibilidad de los ataques entre modelos resultó ser limitada<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Los prompts adversarios, diseñados específicamente contra un modelo, no siempre son igualmente efectivos contra otro<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Se observó que los prompts "trampa" generados para explotar las vulnerabilidades de ChatGPT tenían un efecto mucho más débil en GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Este último se desempeñó mejor, probablemente porque los ataques no se transferían directamente a su arquitectura: lo que confunde a un modelo puede no afectar a un modelo más avanzado con un entrenamiento diferente<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Sin embargo, algunos tipos de distorsiones simples (como los errores tipográficos) tuvieron un efecto negativo en varios modelos a la vez, lo que sugiere puntos débiles similares en su base lingüística.

### Recomendaciones prácticas

Durante el desarrollo de PromptBench, también se identificaron recomendaciones prácticas para usuarios y desarrolladores de LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Una conclusión simple es que la estabilidad de la formulación importa<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Es necesario **evitar errores tipográficos y formulaciones descuidadas en el prompt**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Los autores demuestran que corregir incluso errores menores (ortografía, mayúsculas/minúsculas aleatorias, espacios extra) puede aumentar significativamente la fiabilidad de la respuesta del modelo<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Además, **la elección de las palabras en la instrucción afecta su robustez**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. El análisis de la frecuencia de términos en prompts robustos frente a vulnerables reveló que algunas palabras aparecen más a menudo en prompts "fiables", mientras que otras lo hacen en aquellos donde el modelo falló<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Por ejemplo, los prompts que contenían palabras como "acting", "provided", "detection", etc., rara vez provocaban fallos, mientras que palabras como "respond" ("responde"), "following" ("siguiente") o "examine" ("examina") aparecían en casos más problemáticos<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Esto indica que un cierto estilo y léxico en los prompts puede mitigar o, por el contrario, provocar vulnerabilidades en el modelo. En general, se recomienda formular el prompt de la manera **más clara, inequívoca y en términos familiares para el modelo posible**, especialmente para aplicaciones de misión crítica<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>.

Un efecto secundario interesante observado por los investigadores es el impacto de agregar fragmentos de texto sin sentido o irrelevantes al prompt<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Se descubrió que **insertar una secuencia aleatoria de caracteres** (por ejemplo, «LKF0FZxMZ4») al final o en medio del prompt puede distraer la atención del modelo y **reducir la precisión de su respuesta**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Por otro lado, agregar una frase neutral pero gramaticalmente correcta (por ejemplo, «and true is true» — «y verdadero es verdadero») en algunos casos, por el contrario, **mejoraba la respuesta**, como si enfocara al modelo en las partes importantes de la pregunta<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. Este fenómeno subraya cuán impredeciblemente reaccionan los LLM a detalles de entrada aparentemente insignificantes. También evidencia la complejidad del funcionamiento interno de los modelos: los cambios más pequeños en el contexto pueden perturbar o mejorar su rendimiento, dependiendo de cómo se redistribuye la atención del modelo.

## Importancia y desarrollo futuro

PromptRobust/PromptBench ha hecho una contribución significativa a la comprensión de la fiabilidad de los LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. El benchmark propuesto y los datos recopilados están abiertos a la comunidad: el código y los conjuntos de prompts adversarios están disponibles en el repositorio<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. Esto permite a otros investigadores probar la robustez de nuevos modelos frente a variaciones en los prompts y comparar los resultados<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-arxiv-main-1)</sup>. El siguiente paso es el desarrollo de métodos para proteger los modelos de tales ataques, por ejemplo, algoritmos de entrenamiento mejorados que tengan en cuenta posibles errores tipográficos y paráfrasis, o sistemas integrados para la normalización del texto de entrada<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>. PromptBench ya se considera una base para futuras investigaciones sobre cómo mejorar la **robustez** (*robustness*) de los modelos de lenguaje ante datos de entrada imprecisos del mundo real<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)</sup>.

En última instancia, el trabajo de Zhu y sus colegas demuestra la importancia de considerar la robustez de los prompts al implementar LLM en aplicaciones prácticas: los modelos no solo deben mostrar una alta precisión con datos "limpios", sino también mantener la corrección ante desviaciones menores en la entrada, ya sean errores accidentales del usuario o ataques deliberados<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_note-cmu-realer-4)</sup>.

## Enlaces externos

- <a href="https://arxiv.org/abs/2306.04528" class="external text" rel="nofollow">Artículo original de PromptBench (arXiv)</a>
- <a href="https://github.com/microsoft/PromptBench" class="external text" rel="nofollow">Repositorio de PromptBench en GitHub</a>
- <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external text" rel="nofollow">Artículo «Prompt Robustness: How to Measure and How to Enhance» (Towards AI)</a>

## Bibliografía

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Referencias

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(ES)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
