---
title: "Self‑refine prompting"
source: "https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting"
wiki: "systems-analysis.info/wiki"
article: "Self‑refine_prompting"
language: "ru"
categories:
  - "Категория:Prompt инжиниринг"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 182
wiki_created_at: 2026-09-06T22:04:57Z
wiki_modified_at: 2026-09-06T22:04:57Z
downloaded_at: 2026-09-07T22:18:07Z
---

# Self‑refine prompting

**Self-Refine** (**самоуточнение** или **самокоррекция**) — это подход в области промпт-инжиниринга, позволяющий [большим языковым моделям (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") итеративно улучшать сгенерированный ответ на основе собственной же обратной связи<sup>[\[1\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-madaan2023-1)</sup>. Идея была предложена группой исследователей под руководством Амана Мадаана в 2023 году и основана на наблюдении, что, подобно человеку, языковые модели не всегда генерируют наилучший результат с первой попытки.

В данном методе одна и та же LLM последовательно выполняет три роли:

1.  **Генератор (Generator)**: создаёт начальный черновой ответ на запрос.
2.  **Критик (Feedback)**: оценивает собственный же ответ и предоставляет конструктивную обратную связь.
3.  **Редактор (Refiner)**: использует эту обратную связь для создания улучшенной версии ответа.

Этот итеративный цикл «генерация → обратная связь → улучшение» может повторяться несколько раз, пока не будет достигнуто требуемое качество или выполнено условие остановки.

Важно, что Self-Refine не требует дополнительного обучения модели, тонкой настройки или внешних данных — весь процесс управляется исключительно через промпты на этапе вывода (*inference*)<sup>[\[1\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-madaan2023-1)</sup>.

## Механизм реализации

Метод Self-Refine реализуется через последовательность специально сконструированных промптов, которые направляют поведение модели.

1.  **Начальная генерация**. Модель получает исходный промпт и генерирует черновой ответ.
2.  **Создание обратной связи**. Модель получает инструкцию проанализировать свой же предыдущий ответ и выявить в нём недостатки. Например, она может отметить, что ответ недостаточно подробен или содержит логическую ошибку. Результатом является текстовая обратная связь с конкретными замечаниями и рекомендациями.
3.  **Итеративное улучшение**. Модель получает в качестве нового промпта исходный запрос, свой первоначальный ответ и сгенерированную обратную связь. На основе этого она создаёт улучшенную версию ответа.

Этот двухшаговый цикл «критика → редакция» может выполняться несколько раз. В контекст каждой новой итерации включаются предыдущие варианты ответа и комментарии, что помогает модели избегать повторения ошибок<sup>[\[2\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-selfrefine_info-2)</sup>. Для управления поведением модели часто используются техники *few-shot prompting*, где в промпт включаются примеры желаемого формата обратной связи и исправлений.

## Эффективность и применение

Метод Self-Refine продемонстрировал свою эффективность на ряде задач, требующих многократного уточнения, таких как:

- Генерация диалоговых ответов.
- Творческое продолжение истории.
- Решение математических задач пошаговым рассуждением.
- Оптимизация программного кода.

В оригинальном исследовании ответы, полученные с помощью Self-Refine, в среднем оказались на **~20%** более предпочтительными по оценкам людей и автоматических метрик по сравнению с одноэтапной генерацией<sup>[\[1\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-madaan2023-1)</sup>. Улучшение достигалось даже для самых современных моделей, таких как <a href="https://systems-analysis.info/wiki/index.php?title=GPT-4&amp;action=edit&amp;redlink=1" class="new" title="GPT-4 (страница не существует)">GPT-4</a>, что указывает на то, что даже мощным LLM часто не хватает лишь дополнительного шага размышления для исправления собственных ошибок.

Схожие подходы, такие как **RCI** (Recursive Criticism and Improvement), также показали высокую эффективность в интерактивных задачах, например, в управлении компьютером и решении логических задач. Сочетание RCI с техникой «цепочки мыслей» (Chain-of-Thought) дало синергетический эффект, заметно улучшив способность модели решать сложные проблемы за счёт встроенного шага самопроверки<sup>[\[3\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-kim2023_rci-3)</sup>.

## Ограничения и текущие исследования

Несмотря на обнадёживающие успехи, исследования показывают, что самоитеративное улучшение имеет ряд ограничений.

- **Само-предвзятость (self-bias)**: У моделей возникает трудность беспристрастно судить свои же ответы. LLM склонны благосклонно воспринимать собственный сгенерированный текст и недостаточно критично его оценивать, что может приводить к стагнации или даже ухудшению качества после нескольких итераций<sup>[\[4\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-huang2023-4)</sup>.
- **Чрезмерная уверенность**: Было замечено, что с ростом числа итераций самокоррекции модель может приобретать чрезмерную уверенность в своих ответах, даже если они не стали точнее. Это приводит к росту показателя *Expected Calibration Error (ECE)* — рассогласования между уверенностью модели и реальной точностью<sup>[\[5\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-zhu2025_calibration-5)</sup>.
- **Вычислительные затраты**: Метод требует нескольких обращений к LLM для получения одного финального ответа, что значительно увеличивает задержку и стоимость по сравнению с однопроходной генерацией.

Текущие исследования направлены на решение этих проблем. Одно из направлений — внедрение механизмов калибровки уверенности на каждом шаге итерации. Другое — привлечение внешних источников информации или инструментов (например, выполнение кода, поиск данных) для более объективной самооценки<sup>[\[6\]](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_note-beyond_accuracy_study-6)</sup>.

## Сравнение с другими техниками

- **Chain-of-Thought (CoT)**: CoT фокусируется на генерации линейной цепочки рассуждений, чтобы прийти к ответу. Self-Refine, в свою очередь, фокусируется на итеративном улучшении уже сгенерированного ответа (который может включать CoT).
- **Tree of Thoughts (ToT)**: ToT исследует множество параллельных путей рассуждения в виде дерева, в то время как Self-Refine улучшает один путь итеративно. ToT — это техника исследования пространства решений, а Self-Refine — техника оптимизации конкретного решения.

## См. также

- [Meta Prompting](https://systems-analysis.info/wiki/Meta_Prompting "Meta Prompting")
- [Основные приёмы Prompt Engineering](https://systems-analysis.info/wiki/%D0%9E%D1%81%D0%BD%D0%BE%D0%B2%D0%BD%D1%8B%D0%B5_%D0%BF%D1%80%D0%B8%D1%91%D0%BC%D1%8B_Prompt_Engineering "Основные приёмы Prompt Engineering")
- [Self-Consistency prompting](https://systems-analysis.info/wiki/Self-Consistency_prompting "Self-Consistency prompting")
- [Chain-of-Thought Prompting](https://systems-analysis.info/wiki/Chain-of-Thought_Prompting "Chain-of-Thought Prompting")
- [Generated Knowledge Prompting](https://systems-analysis.info/wiki/Generated_Knowledge_Prompting "Generated Knowledge Prompting")

## Ссылки

- <a href="https://selfrefine.info/" class="external text" rel="nofollow">Официальный сайт проекта Self-Refine</a>
- <a href="https://arxiv.org/abs/2303.17651" class="external text" rel="nofollow">Оригинальная научная статья "Self-Refine: Iterative Refinement with Self-Feedback"</a>

## Литература

- Madaan, A. et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*. <a href="https://arxiv.org/abs/2303.17651" class="external text" rel="nofollow">arXiv:2303.17651</a>.
- Kim, G. et al. (2023). *Language Models Can Solve Computer Tasks*. <a href="https://arxiv.org/abs/2303.17491" class="external text" rel="nofollow">arXiv:2303.17491</a>.
- Gou, Z. et al. (2023). *CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing*. <a href="https://arxiv.org/abs/2305.11738" class="external text" rel="nofollow">arXiv:2305.11738</a>.
- Huang, J. et al. (2023). *Large Language Models Cannot Self-Correct Reasoning Yet*. <a href="https://arxiv.org/abs/2310.01798" class="external text" rel="nofollow">arXiv:2310.01798</a>.
- Pan, L. et al. (2023). *Automatically Correcting Large Language Models: Surveying the Landscape of Diverse Self-Correction Strategies*. <a href="https://arxiv.org/abs/2308.03188" class="external text" rel="nofollow">arXiv:2308.03188</a>.
- Jiang, C. et al. (2024). *Importance Weighting Can Help Large Language Models Self-Improve*. <a href="https://arxiv.org/abs/2408.09849" class="external text" rel="nofollow">arXiv:2408.09849</a>.
- Liang, X. et al. (2024). *Internal Consistency and Self-Feedback in Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2407.14507" class="external text" rel="nofollow">arXiv:2407.14507</a>.
- Zhu, D. et al. (2025). *Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models*. <a href="https://arxiv.org/abs/2504.02902" class="external text" rel="nofollow">arXiv:2504.02902</a>.
- Hao, Q. et al. (2025). *RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning*. <a href="https://arxiv.org/abs/2505.14140" class="external text" rel="nofollow">arXiv:2505.14140</a>.
- Cui, Y. et al. (2023). *Check Your Facts and Try Again: Improving Large Language Models by Reducing Hallucination*. <a href="https://arxiv.org/abs/2302.12813" class="external text" rel="nofollow">arXiv:2302.12813</a>.
- Wei, Z. et al. (2024). *ReSearch: Iterative Self-Reflection for Better LLM Calibration*. <a href="https://arxiv.org/abs/2405.13022" class="external text" rel="nofollow">arXiv:2405.13022</a>.

## Примечания

1.  <span id="cite_note-madaan2023-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-madaan2023_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-madaan2023_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-madaan2023_1-2)</sup> Madaan, Aman; et al. «Self-Refine: Iterative Refinement with Self-Feedback». *arXiv*. <a href="https://arxiv.org/abs/2303.17651" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-selfrefine_info-2">[↑](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-selfrefine_info_2-0) «Self-Refine: Iterative Refinement with Self-Feedback». *Официальный сайт проекта*. <a href="https://selfrefine.info/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kim2023_rci-3">[↑](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-kim2023_rci_3-0) Kim, Geunwoo; et al. «Language Models can Solve Computer Tasks». *arXiv*. <a href="https://arxiv.org/abs/2303.17491" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huang2023-4">[↑](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-huang2023_4-0) Huang, Jie; et al. «Large Language Models Cannot Self-Correct Reasoning Yet». *arXiv*. <a href="https://arxiv.org/abs/2310.08118" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zhu2025_calibration-5">[↑](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-zhu2025_calibration_5-0) Zhu, D., et al. (2025). «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-beyond_accuracy_study-6">[↑](https://systems-analysis.info/wiki/Self%E2%80%91refine_prompting#cite_ref-beyond_accuracy_study_6-0) «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[6]</a></span>
