Multi-agent prompting (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Nhắc lệnh đa tác nhân (tiếng Anh: multi-agent prompting) — là một phương pháp trong kỹ thuật prompt và các hệ thống trí tuệ nhân tạo, trong đó nhiều tác nhân tự trị dựa trên các mô hình ngôn ngữ lớn (LLM) tương tác với nhau để giải quyết các bài toán phức tạp thông qua trao đổi chỉ dẫn và phản hồi có cấu trúc[1].

Nói cách khác, hệ thống đa tác nhân bao gồm nhiều LLM-agent cùng phối hợp xử lý một yêu cầu phức tạp của người dùng, phân phối các bước suy luận (subtasks) cho các tác nhân với các «vai trò» và năng lực khác nhau. Mục tiêu chính của cách tiếp cận này là vượt qua những hạn chế của một mô hình đơn lẻ trên các bài toán khó thông qua giải pháp tập thể. Việc sử dụng nhiều tác nhân tương tác nhằm nâng cao chất lượng suy luận, độ chính xác về mặt thực tế và độ tin cậy của câu trả lời[2]. Một đặc điểm quan trọng là tính chỉ dẫn chặt chẽ: mỗi LLM được giao một vai trò hoặc nhiệm vụ cụ thể trong khuôn khổ sơ đồ giải quyết tổng thể.

Phương pháp và các mẫu kiến trúc

Các nhà nghiên cứu đã đề xuất một số sơ đồ nhắc lệnh đa tác nhân, khác nhau về bản chất tương tác giữa các tác nhân và vai trò của chúng.

Mô hình hóa chuyên gia theo vai trò

Một hoặc nhiều tác nhân được chỉ định là chuyên gia miền với chuyên môn hẹp. Ví dụ, trong một nhóm đa tác nhân, các tác nhân khác nhau có thể đại diện cho các lĩnh vực tri thức khác nhau (nhà vật lý, nhà hóa học, nhà sinh học) hoặc các giai đoạn giải quyết bài toán khác nhau (người lập kế hoạch, người thực thi, người phản biện)[1]. Cách tiếp cận này cho phép thực hiện few-shot prompting hiệu quả, trong đó mỗi tác nhân chuyên gia nhận được các ví dụ minh họa trong lĩnh vực của mình, cải thiện hiệu suất tổng thể.

Tự sửa lỗi và phản biện (Self-reflection)

Một tác nhân có thể đóng vai «người phản biện» hoặc phản tư về các giải pháp của tác nhân khác hay các câu trả lời trước đó của chính mình. Chiến lược self-reflection hoặc self-refinement nằm ở chỗ LLM đầu tiên tạo ra câu trả lời, sau đó chính nó hoặc một mô hình khác phân tích và sửa lỗi trong câu trả lời đó[1]. Điều này cho phép cải thiện kết quả cuối cùng theo từng bước lặp.

Tranh luận giữa các tác nhân

Biến thể cạnh tranh của nhắc lệnh đa tác nhân, đại diện cho việc tổ chức thảo luận hoặc tranh luận giữa nhiều LLM. Trong sơ đồ LLM-Debate, hai hoặc nhiều tác nhân tranh luận về câu trả lời đúng cho một bài toán (ví dụ, bài toán toán học) và phản biện lập luận của nhau[3]. Định dạng tranh luận như vậy cải thiện khả năng suy luận logic của mô hình và nâng cao độ chính xác thực tế của các câu trả lời so với giải pháp đơn lẻ.

Lập kế hoạch và phân rã bài toán

Một tác nhân thực hiện chức năng lập kế hoạch, chia nhỏ yêu cầu phức tạp thành chuỗi các bước hoặc bài toán con, sau đó được giải quyết bởi chính nó hoặc các tác nhân khác. Các phương pháp như ReActReflexion thực hiện nguyên tắc lập kế hoạch lặp với phản hồi. LLM đầu tiên tạo ra kế hoạch giải quyết trước khi bắt đầu thực hiện nó, điều này giúp xử lý các chuỗi suy luận dài[1].

Hợp tác đa nhân cách

Thay vì các mô hình khác nhau, có thể sử dụng cùng một LLM, buộc nó «đóng vai» nhiều tác nhân với các thiết lập nhân cách hoặc quan điểm khác nhau. Trong cách tiếp cận multi-persona self-collaboration, một mô hình trong quá trình đối thoại lần lượt đảm nhận nhiều vai trò và tiến hành thảo luận như thể tự nói chuyện với chính mình. Mặc dù nghiên cứu cho thấy các tác nhân độc lập riêng biệt đảm bảo hiệu quả cao hơn, phương pháp này cho phép mô phỏng một nhóm chuyên gia bên trong một LLM duy nhất[1].

Ứng dụng và kết quả

Cách tiếp cận nhắc lệnh đa tác nhân đã chứng minh hiệu quả trong một số lĩnh vực mà các LLM đơn lẻ trước đây gặp khó khăn.

Suy luận toán học và logic

Việc sử dụng nhiều tác nhân nâng cao đáng kể độ chính xác trên các bài toán đòi hỏi suy diễn nhiều bước (số học phức tạp, chứng minh toán học, câu đố logic). Trong nghiên cứu Du et al. (2023), cách tiếp cận «tranh luận» đa tác nhân đã cải thiện kết quả so với tác nhân đơn lẻ. Phân tích cho thấy khi số lượng tác nhân tham gia thảo luận tăng lên, độ chính xác của câu trả lời cũng tăng theo[3].

Bài toán khoa học và kỹ thuật

Đối với các bài toán chuyên ngành phức tạp (vật lý, hóa học), phương pháp CoMM (Collaborative Multi-Agent, Multi-Reasoning-Path Prompting) đã được đề xuất, trong đó nhiều LLM-agent với các vai trò khác nhau (chuyên gia) áp dụng các chiến lược suy luận khác nhau song song. Trong các thử nghiệm trên bài toán vật lý cấp đại học, CoMM đã vượt trội đáng kể so với các cách tiếp cận cơ bản như chain-of-thought, mắc ít lỗi hơn trong công thức và tính toán[1].

Tạo và gỡ lỗi mã

Trong lĩnh vực lập trình, các hệ thống đa tác nhân được áp dụng để cải thiện chất lượng mã và giảm số lượng lỗi. Hệ thống PromptV sử dụng nhiều tác nhân để viết, kiểm tra và sửa mã Verilog theo trình tự. Việc phân chia vai trò (tạo mã, xem xét, kiểm thử) đã cải thiện khả năng phát hiện và sửa lỗi của mô hình, kết quả là tỷ lệ các giải pháp biên dịch thành công tăng lên 96,5% trên một trong các benchmark[4].

Tìm kiếm và phân tích thông tin

Các hệ thống đa tác nhân đặc biệt hữu ích cho các truy vấn mở, ít có cấu trúc. Công ty Anthropic đã phát triển chế độ đa tác nhân cho mô hình Claude, được thiết kế để nghiên cứu trên web. Trong hệ thống này, tác nhân chủ phân tích yêu cầu và sinh ra nhiều tác nhân con song song, mỗi tác nhân thực hiện tìm kiếm về các khía cạnh khác nhau của chủ đề. Kiến trúc như vậy xử lý các câu hỏi tìm kiếm phức tạp hiệu quả hơn 90% so với một mô hình Claude duy nhất[2].

Phân loại văn bản và các bài toán NLP

Đối với các bài toán NLP, nhắc lệnh định hướng nguyên tắc (Principle-Based Prompting) đã được phát triển. Trong phương pháp này, các LLM-agent đầu tiên tạo ra tập hợp «nguyên tắc» (quy tắc giải quyết), sau đó một tác nhân cuối cùng chọn ra những nguyên tắc tốt nhất, dựa trên đó một tác nhân khác thực hiện phân loại. Cách tiếp cận này đã cải thiện chỉ số macro-F1 lên 1,5–19% so với các phương pháp cơ bản, tiệm cận về chất lượng với việc học trên ví dụ truyền thống (few-shot)[5].

Hạn chế và vấn đề

Độ phức tạp tính toán và chi phí

Nhược điểm chính là tải tính toán tăng mạnh. Mỗi tác nhân đòi hỏi phiên tạo sinh riêng, dẫn đến tiêu hao đáng kể token và tài nguyên. Theo dữ liệu từ Anthropic, hệ thống của họ tiêu thụ trung bình nhiều hơn 4 lần token cho mỗi cuộc đối thoại, và trong một số trường hợp — nhiều hơn đến 15 lần[2]. Điều này làm cho việc áp dụng cách tiếp cận này chỉ hợp lý cho các bài toán có giá trị cao.

Độ phức tạp trong thiết kế và phối hợp

Để hoạt động thành công, cần có tinh chỉnh kỹ thuật prompt cẩn thận: cần xác định rõ vai trò của từng tác nhân, định dạng trao đổi thông điệp và tiêu chí dừng. Nếu không, các tác nhân có thể trùng lặp công việc, rơi vào vòng tìm kiếm vô tận hoặc tạo ra các bài toán con vô ích[2].

Bảo mật và độ tin cậy

Các véc-tơ tấn công mới xuất hiện. Các nhà nghiên cứu đã chứng minh hiện tượng Prompt Infection (lây nhiễm prompt), khi một đoạn chỉ dẫn độc hại từ một tác nhân được truyền sang tác nhân khác, lan truyền qua toàn bộ chuỗi suy luận như virus. Cuộc tấn công LLM-to-LLM như vậy cho thấy sự dễ bị tổn thương của các hệ thống đa tác nhân trước các kỹ thuật tiêm nhiễm ẩn và thao túng, đòi hỏi phải phát triển các biện pháp bảo vệ đặc biệt, ví dụ như gắn nhãn đầu ra của từng tác nhân (LLM Tagging)[6].

Tham khảo

  • «How we built our multi-agent research system» — phân tích chi tiết từ Anthropic
  • «More Agents Is All You Need» — bài báo khoa học về hiệu quả của các tập hợp tác nhân

Tài liệu

  • Chen, P. et al. (2024). CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving. arXiv:2404.17729.
  • Li, J. et al. (2024). More Agents Is All You Need. arXiv:2402.05120.
  • Mi, Y. et al. (2024). PromptV: Leveraging LLM-Powered Multi-Agent Prompting for High-Quality Verilog Generation. arXiv:2412.11014.
  • Wei, P. et al. (2024). Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification. arXiv:2502.07165.
  • Lee, D.; Tiwari, A. (2024). Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems. arXiv:2410.07283.
  • Fernando, C. et al. (2023). PromptBreeder: Self-Referential Self-Improvement via Prompt Evolution. arXiv:2309.16797.
  • Wu, Q. et al. (2023). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155.
  • Liu, X. et al. (2023). AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688.
  • Li, G. et al. (2024). Multi-LLM Debate: Framework, Principles, and Interventions. PDF.
  • Du, N. et al. (2023). Improving Factuality and Reasoning in Language Models through Multi-Agent Debate. arXiv:2305.14325.

Chú thích

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Chen, Y. et al. «CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving». arXiv, 2024. [1]
  2. 2.0 2.1 2.2 2.3 «How we built our multi-agent research system». Anthropic. [2]
  3. 3.0 3.1 Li, G. et al. «More Agents Is All You Need». arXiv, 2024. [3]
  4. Mi, Y. et al. «PromptV: Leveraging LLM-powered Multi-Agent Prompting for High-quality Verilog Generation». ResearchGate, 2024. [4]
  5. Wei, J. et al. «Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification». arXiv, 2024. [5]
  6. Lee, K. & Tiwari, A. «Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems». OpenReview, 2024. [6]