---
title: "Self-Refine Prompting (VI)"
source: "https://systems-analysis.info/int/Self-Refine_Prompting_(VI)"
wiki: "systems-analysis.info/int"
article: "Self-Refine_Prompting_(VI)"
language: "vi"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
  - "Category:Vietnamese"
revision_id: 6628
wiki_created_at: 2026-09-07T00:07:59Z
wiki_modified_at: 2026-09-07T00:07:59Z
downloaded_at: 2026-09-07T23:14:54Z
---

# Self-Refine Prompting (VI)

**Self-Refine** (**tự tinh chỉnh** hay **tự hiệu chỉnh**) — là một phương pháp trong lĩnh vực prompt engineering, cho phép các mô hình ngôn ngữ lớn (LLM) cải thiện lặp đi lặp lại câu trả lời đã tạo ra dựa trên chính phản hồi của mình<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-madaan2023-1)</sup>. Ý tưởng này được đề xuất bởi nhóm các nhà nghiên cứu dưới sự dẫn dắt của Aman Madaan vào năm 2023 và dựa trên quan sát rằng, tương tự như con người, các mô hình ngôn ngữ không phải lúc nào cũng tạo ra kết quả tốt nhất ngay từ lần thử đầu tiên.

Trong phương pháp này, cùng một LLM thực hiện tuần tự ba vai trò:

1.  **Bộ tạo (Generator)**: tạo ra câu trả lời nháp ban đầu cho yêu cầu.
2.  **Bộ phê bình (Feedback)**: đánh giá chính câu trả lời của mình và cung cấp phản hồi mang tính xây dựng.
3.  **Bộ biên tập (Refiner)**: sử dụng phản hồi đó để tạo ra phiên bản cải tiến của câu trả lời.

Vòng lặp lặp đi lặp lại «tạo sinh → phản hồi → cải thiện» này có thể được lặp lại nhiều lần cho đến khi đạt được chất lượng yêu cầu hoặc điều kiện dừng được thỏa mãn.

Điều quan trọng là Self-Refine không yêu cầu huấn luyện thêm mô hình, fine-tuning hay dữ liệu bên ngoài — toàn bộ quá trình được điều khiển hoàn toàn thông qua các prompt trong giai đoạn *inference*<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-madaan2023-1)</sup>.

## Cơ chế thực hiện

Phương pháp Self-Refine được thực hiện thông qua một chuỗi các prompt được thiết kế đặc biệt nhằm định hướng hành vi của mô hình.

1.  **Tạo sinh ban đầu**. Mô hình nhận prompt đầu vào và tạo ra câu trả lời nháp.
2.  **Tạo phản hồi**. Mô hình nhận chỉ thị phân tích chính câu trả lời trước đó của mình và xác định các điểm còn hạn chế. Ví dụ, mô hình có thể nhận xét rằng câu trả lời chưa đủ chi tiết hoặc chứa lỗi logic. Kết quả là một phản hồi dạng văn bản với các nhận xét và khuyến nghị cụ thể.
3.  **Cải thiện lặp đi lặp lại**. Mô hình nhận làm prompt mới gồm: yêu cầu gốc, câu trả lời ban đầu của mình và phản hồi đã tạo ra. Dựa trên đó, mô hình tạo ra phiên bản cải tiến của câu trả lời.

Vòng lặp hai bước «phê bình → biên tập» này có thể thực hiện nhiều lần. Ngữ cảnh của mỗi vòng lặp mới bao gồm các phiên bản câu trả lời trước và các nhận xét, giúp mô hình tránh lặp lại lỗi<sup>[\[2\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-selfrefine_info-2)</sup>. Để điều khiển hành vi của mô hình, kỹ thuật *few-shot prompting* thường được sử dụng, trong đó các ví dụ về định dạng phản hồi và chỉnh sửa mong muốn được đưa vào prompt.

## Hiệu quả và ứng dụng

Phương pháp Self-Refine đã chứng tỏ hiệu quả trên một số tác vụ đòi hỏi tinh chỉnh nhiều lần, chẳng hạn như:

- Tạo sinh câu trả lời hội thoại.
- Tiếp tục câu chuyện sáng tạo.
- Giải các bài toán toán học theo từng bước suy luận.
- Tối ưu hóa mã nguồn.

Trong nghiên cứu gốc, các câu trả lời thu được bằng Self-Refine trung bình được ưa thích hơn **~20%** theo đánh giá của con người và các chỉ số tự động so với tạo sinh một bước<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-madaan2023-1)</sup>. Sự cải thiện đạt được ngay cả với các mô hình tiên tiến nhất như GPT-4, cho thấy rằng ngay cả các LLM mạnh mẽ cũng thường chỉ cần thêm một bước suy nghĩ để tự sửa lỗi của mình.

Các phương pháp tương tự như **RCI** (Recursive Criticism and Improvement) cũng cho thấy hiệu quả cao trong các tác vụ tương tác, ví dụ như điều khiển máy tính và giải các bài toán logic. Sự kết hợp giữa RCI và kỹ thuật «chuỗi suy nghĩ» (Chain-of-Thought) tạo ra hiệu ứng cộng hưởng, cải thiện đáng kể khả năng của mô hình trong việc giải quyết các vấn đề phức tạp nhờ bước tự kiểm tra tích hợp<sup>[\[3\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-kim2023_rci-3)</sup>.

## Hạn chế và các nghiên cứu hiện tại

Mặc dù có những thành công đáng khích lệ, các nghiên cứu cho thấy việc tự cải thiện lặp đi lặp lại có một số hạn chế.

- **Thiên kiến bản thân (self-bias)**: Các mô hình gặp khó khăn trong việc đánh giá khách quan các câu trả lời của chính mình. LLM có xu hướng nhìn nhận thiện chí văn bản do mình tạo ra và đánh giá nó chưa đủ nghiêm túc, điều này có thể dẫn đến trì trệ hoặc thậm chí giảm chất lượng sau một số vòng lặp<sup>[\[4\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-huang2023-4)</sup>.
- **Sự tự tin thái quá**: Người ta nhận thấy rằng khi số vòng tự hiệu chỉnh tăng lên, mô hình có thể trở nên quá tự tin vào các câu trả lời của mình, ngay cả khi chúng không trở nên chính xác hơn. Điều này dẫn đến sự gia tăng chỉ số *Expected Calibration Error (ECE)* — sự không khớp giữa độ tự tin của mô hình và độ chính xác thực tế<sup>[\[5\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-zhu2025_calibration-5)</sup>.
- **Chi phí tính toán**: Phương pháp yêu cầu nhiều lần truy vấn LLM để nhận được một câu trả lời cuối cùng, làm tăng đáng kể độ trễ và chi phí so với tạo sinh một lần.

Các nghiên cứu hiện tại hướng đến giải quyết những vấn đề này. Một hướng là tích hợp các cơ chế hiệu chỉnh độ tự tin ở mỗi bước lặp. Hướng khác là thu hút các nguồn thông tin hoặc công cụ bên ngoài (ví dụ: thực thi mã, tìm kiếm dữ liệu) để tự đánh giá khách quan hơn<sup>[\[6\]](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_note-beyond_accuracy_study-6)</sup>.

## So sánh với các kỹ thuật khác

- **Chain-of-Thought (CoT)**: CoT tập trung vào việc tạo ra một chuỗi suy luận tuyến tính để đi đến câu trả lời. Self-Refine, ngược lại, tập trung vào việc cải thiện lặp đi lặp lại câu trả lời đã được tạo ra (trong đó có thể bao gồm CoT).
- **Tree of Thoughts (ToT)**: ToT khám phá nhiều đường suy luận song song theo dạng cây, trong khi Self-Refine cải thiện một đường duy nhất một cách lặp đi lặp lại. ToT là kỹ thuật khám phá không gian giải pháp, còn Self-Refine là kỹ thuật tối ưu hóa một giải pháp cụ thể.

## Liên kết

- Trang web chính thức của dự án Self-Refine
- Bài báo khoa học gốc "Self-Refine: Iterative Refinement with Self-Feedback"

## Tài liệu tham khảo

- Madaan, A. et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*. arXiv:2303.17651.
- Kim, G. et al. (2023). *Language Models Can Solve Computer Tasks*. arXiv:2303.17491.
- Gou, Z. et al. (2023). *CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing*. arXiv:2305.11738.
- Huang, J. et al. (2023). *Large Language Models Cannot Self-Correct Reasoning Yet*. arXiv:2310.01798.
- Pan, L. et al. (2023). *Automatically Correcting Large Language Models: Surveying the Landscape of Diverse Self-Correction Strategies*. arXiv:2308.03188.
- Jiang, C. et al. (2024). *Importance Weighting Can Help Large Language Models Self-Improve*. arXiv:2408.09849.
- Liang, X. et al. (2024). *Internal Consistency and Self-Feedback in Large Language Models: A Survey*. arXiv:2407.14507.
- Zhu, D. et al. (2025). *Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models*. arXiv:2504.02902.
- Hao, Q. et al. (2025). *RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning*. arXiv:2505.14140.
- Cui, Y. et al. (2023). *Check Your Facts and Try Again: Improving Large Language Models by Reducing Hallucination*. arXiv:2302.12813.
- Wei, Z. et al. (2024). *ReSearch: Iterative Self-Reflection for Better LLM Calibration*. arXiv:2405.13022.

## Chú thích

1.  <span id="cite_note-madaan2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-madaan2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-madaan2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-madaan2023_1-2)</sup> Madaan, Aman; et al. «Self-Refine: Iterative Refinement with Self-Feedback». *arXiv*. <a href="https://arxiv.org/abs/2303.17651" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-selfrefine_info-2">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-selfrefine_info_2-0) «Self-Refine: Iterative Refinement with Self-Feedback». *Официальный сайт проекта*. <a href="https://selfrefine.info/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kim2023_rci-3">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-kim2023_rci_3-0) Kim, Geunwoo; et al. «Language Models can Solve Computer Tasks». *arXiv*. <a href="https://arxiv.org/abs/2303.17491" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huang2023-4">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-huang2023_4-0) Huang, Jie; et al. «Large Language Models Cannot Self-Correct Reasoning Yet». *arXiv*. <a href="https://arxiv.org/abs/2310.08118" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-zhu2025_calibration-5">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-zhu2025_calibration_5-0) Zhu, D., et al. (2025). «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-beyond_accuracy_study-6">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(VI)#cite_ref-beyond_accuracy_study_6-0) «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[6]</a></span>
