Prompt (language models) (VI)
Prompt (từ tiếng Anh prompt — «gợi ý» hoặc «yêu cầu văn bản») trong ngữ cảnh của các mô hình ngôn ngữ lớn (LLM) — là văn bản đầu vào hoặc hướng dẫn mà người dùng cung cấp cho mô hình để tạo ra phản hồi mong muốn[1]. Prompt định nghĩa nhiệm vụ cho mô hình, bao gồm các điều kiện cần thiết, ngữ cảnh và ví dụ. Hiệu quả hoạt động của mô hình phụ thuộc phần lớn vào chất lượng của prompt được soạn thảo.
Lĩnh vực nghiên cứu các phương pháp phát triển và tối ưu hóa yêu cầu văn bản được gọi là prompt engineering (kỹ thuật prompt). Mục tiêu của nó là thu được từ các mô hình AI những phản hồi có mức độ liên quan, chính xác và an toàn cao nhất[2]. Một prompt được soạn thảo tốt sẽ thiết lập cho mô hình «lộ trình» thực hiện nhiệm vụ, giúp làm rõ ngữ cảnh cần thiết và kết quả mong muốn[1].
Lịch sử phát triển của phương pháp
Ý tưởng điều khiển hành vi của LLM thông qua các gợi ý văn bản đã phát triển cùng với sự tăng trưởng khả năng của chính các mô hình.
Giai đoạn đầu (GPT-2)
Ngay từ năm 2019, các nhà nghiên cứu của OpenAI đã chứng minh rằng các mô hình ngôn ngữ lớn được huấn luyện trước, chẳng hạn như GPT-2, có khả năng giải quyết các nhiệm vụ mới mà không cần huấn luyện bổ sung, nếu các nhiệm vụ đó được trình bày dưới dạng văn bản. Công trình «Language Models are Unsupervised Multitask Learners» đánh dấu một bước chuyển biến mang tính nguyên tắc: thay vì tinh chỉnh mô hình cho từng nhiệm vụ, chỉ cần soạn thảo một hướng dẫn rõ ràng ở đầu vào là đủ[3].
Bước đột phá với GPT-3 và In-Context Learning
Bước đột phá thực sự xảy ra khi mô hình GPT-3 ra mắt vào năm 2020. Với 175 tỷ tham số, GPT-3 đã thể hiện khả năng học trong ngữ cảnh (in-context learning) — tiếp thu nhiệm vụ mới «ngay lập tức» từ một vài ví dụ được cung cấp trực tiếp trong văn bản yêu cầu[3]. Chế độ hoạt động này được gọi là few-shot learning («học với một vài ví dụ») và cho thấy rằng việc mở rộng quy mô mô hình dẫn đến chất lượng thực hiện các nhiệm vụ NLP cao mà không cần bất kỳ điều chỉnh trọng số nào.
Sự xuất hiện của Chain-of-Thought (CoT)
Sự phát triển tiếp theo vào năm 2022 gắn liền với việc cải thiện khả năng suy luận logic phức tạp của các mô hình. Các gợi ý đặc biệt theo định dạng chuỗi suy luận (chain-of-thought prompting) đã được đề xuất. Trong các prompt như vậy, mô hình nhận không chỉ câu hỏi mà còn cả ví dụ về quá trình suy luận tuần tự, từng bước trước khi đưa ra câu trả lời. Điều này đã cải thiện đáng kể độ chính xác trong các bài toán số học và logic[2]. Nghiên cứu của Kojima và các đồng nghiệp cho thấy rằng có thể kích thích mô hình suy luận ngay cả khi không có ví dụ (zero-shot), chỉ đơn giản bằng cách thêm cụm từ «Hãy suy nghĩ từng bước» vào cuối yêu cầu[2].
Prompt đa phương thức
Khái niệm prompt đã vượt ra ngoài giới hạn của văn bản. Năm 2022, với sự xuất hiện của các mô hình DALL-E 2 và Stable Diffusion, các yêu cầu của người dùng bằng ngôn ngữ tự nhiên đã trở thành giao diện phổ quát để tạo hình ảnh, và sau đó là âm nhạc và video.
Các loại và kỹ thuật sử dụng prompt
Có một số loại và kỹ thuật prompt chính thường được kết hợp với nhau.
Zero-shot prompting (Yêu cầu trực tiếp)
Mô hình chỉ nhận hướng dẫn hoặc câu hỏi mà không có bất kỳ ví dụ nào. Trong chế độ này, LLM dựa vào kiến thức chung thu được trong quá trình huấn luyện trước. Phù hợp với các nhiệm vụ đơn giản như dịch thuật hoặc tóm tắt văn bản[1].
Few-shot prompting (Học từ ví dụ)
Ngoài hướng dẫn, prompt còn bao gồm một hoặc nhiều ví dụ với đầu vào và đầu ra mong đợi. Mô hình «học ngay lập tức» từ các mẫu này và áp dụng logic đã tiếp thu vào yêu cầu mới. Phương pháp này, thực hiện in-context learning, cải thiện đáng kể độ chính xác trong các nhiệm vụ quan trọng về định dạng hoặc phong cách phản hồi cụ thể[1].
Chuỗi suy luận (Chain-of-Thought, CoT)
Một loại prompt đặc biệt dành cho các nhiệm vụ đòi hỏi suy luận phức tạp (toán học, logic). Gợi ý bao gồm phân tích từng bước hoặc kế hoạch giải quyết trước khi đưa ra câu trả lời cuối cùng. Điều này buộc mô hình phải cấu trúc rõ ràng quá trình suy luận, từ đó cải thiện đáng kể chất lượng kết quả[2].
Tinh chỉnh gợi ý (Prompt Tuning)
Kỹ thuật trong đó thay vì viết prompt thủ công, sử dụng một gợi ý được tối ưu hóa tự động. Prompt được biểu diễn dưới dạng một tập hợp các token có thể huấn luyện đặc biệt (vectơ liên tục), được thêm vào yêu cầu của người dùng. Bằng cách chỉ huấn luyện vectơ-prompt nhỏ này, có thể thích ứng một mô hình lớn «đóng băng» với nhiệm vụ mới với chi phí tính toán tối thiểu[2].
Prompt engineering với tư cách là một lĩnh vực
Sự xuất hiện của nghề nghiệp
Sự tăng trưởng khả năng của LLM đã dẫn đến sự xuất hiện của một chuyên ngành mới — kỹ sư prompt. Các chuyên gia này phát triển và tinh chỉnh các gợi ý văn bản để thu được hành vi mong muốn từ AI. Kỹ sư prompt sử dụng kiến thức trong lĩnh vực ngôn ngữ học, logic và tâm lý học để cấu trúc dữ liệu đầu vào theo cách hiệu quả nhất[2]. Trong giai đoạn 2022–2023, các vị trí tuyển dụng đầu tiên cho chức danh này đã xuất hiện, phản ánh nhu cầu cao về kỹ năng tương tác hiệu quả với các hệ thống AI.
Tương lai của nghề nghiệp và tự động hóa
Lĩnh vực này đang phát triển nhanh chóng và tương lai của nó là chủ đề tranh luận. Các nghiên cứu năm 2024, ví dụ từ VMware, cho thấy bản thân AI có khả năng tìm ra các cách diễn đạt yêu cầu hiệu quả thông qua việc duyệt và tối ưu hóa, thường vượt trội hơn so với con người[4]. Điều này đã tạo ra quan điểm cho rằng prompt engineering thủ công có thể chỉ là hiện tượng tạm thời, và theo thời gian, các công cụ tự động lựa chọn gợi ý sẽ trở thành tiêu chuẩn. Tuy nhiên, tính đến năm 2025, chuyên môn trong lĩnh vực prompt engineering vẫn còn được săn đón.
Lĩnh vực ứng dụng
- Xử lý ngôn ngữ tự nhiên: Các nhiệm vụ NLP truyền thống như tóm tắt tài liệu tự động, dịch máy, trả lời câu hỏi và trích xuất thông tin.
- Chatbot và trợ lý ảo: Prompt giúp xác định vai trò, phong cách giao tiếp và định dạng phản hồi, làm cho các hệ thống đối thoại nhất quán và hữu ích hơn.
- Tạo mã: Các mô hình như OpenAI Codex có khả năng viết mã chương trình theo mô tả bằng ngôn ngữ tự nhiên, giúp tăng tốc quá trình phát triển.
- Phân tích dữ liệu: Sử dụng prompt có thể cấu hình mô hình để trích xuất thông tin chi tiết từ các báo cáo văn bản phi cấu trúc hoặc tạo ra các giả thuyết.
- Giáo dục: Tạo ra các gia sư thông minh có thể tạo bài tập, giải thích các khái niệm phức tạp và kiểm tra câu trả lời dựa trên trình độ của học sinh.
- Các ngành sáng tạo: Tạo văn bản, hình ảnh nghệ thuật, âm nhạc và kịch bản theo mô tả chi tiết.
Sử dụng độc hại và các lỗ hổng (Prompt Injection)
Tính mở của giao diện LLM đã dẫn đến sự xuất hiện của một lớp tấn công mới — chèn gợi ý (prompt injection). Kẻ tấn công soạn thảo một yêu cầu độc hại đặc biệt, khiến mô hình vi phạm các hướng dẫn ban đầu của nó hoặc tiết lộ thông tin ẩn[2]. Các chuyên gia coi đây là một biến thể của cuộc tấn công «chèn mã», trong đó thay vì mã, các hướng dẫn văn bản nguy hiểm được «tiêm» vào hệ thống.
Các loại tấn công
- Jailbreak: Cuộc tấn công cho phép mô hình «thoát khỏi» các hạn chế được áp đặt (ví dụ: chính sách kiểm duyệt) và tạo ra nội dung bị cấm. Ví dụ nổi tiếng là DAN-prompt (Do Anything Now), khiến ChatGPT trả lời không qua kiểm duyệt.
- Prompt Leaking: Một yêu cầu đặc biệt buộc mô hình tiết lộ các đoạn trong system prompt ẩn của nó.
- Token Smuggling: Hướng dẫn độc hại được ngụy trang thành một phần vô hại của yêu cầu (ví dụ: đoạn mã), nhằm vượt qua các bộ lọc và gây ra hành vi không mong muốn.
Các cuộc tấn công này đặt ra một vấn đề nghiêm trọng, vì các phương pháp an ninh mạng truyền thống không phù hợp với các mối đe dọa liên quan đến việc diễn giải ngôn ngữ tự nhiên.
Tài liệu tham khảo
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
- Li, X. L.; Liang, P. (2021). Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190.
- Liu, Y. et al. (2021). Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity. arXiv:2104.08786.
- Chang, K. et al. (2024). Efficient Prompting Methods for Large Language Models: A Survey. arXiv:2404.01077.
- Li, Z. et al. (2024). Prompt Compression for Large Language Models: A Survey. arXiv:2410.12388.
- Genkina, D. (2024). AI Prompt Engineering Is Dead. IEEE Spectrum. [5].
- Li, W. et al. (2025). A Survey of Automatic Prompt Engineering: An Optimization Perspective. arXiv:2502.11560.
- Wu, Z. et al. (2025). The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models. EMNLP 2025. PDF.
Chú thích
- ↑ 1.0 1.1 1.2 1.3 «Prompt Engineering for AI Guide». Google Cloud. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Техника подсказок». Википедия. [2]
- ↑ 3.0 3.1 Brown, Tom B., et al. «Language Models are Few-Shot Learners». arXiv:2005.14165 [cs.CL], 28 мая 2020 г. [3]
- ↑ «AI Prompt Engineering Is Dead». IEEE Spectrum. [4]