Multi-agent prompting (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Multiagent prompting (Engels: multi-agent prompting) — dit is een methode in prompt engineering en kunstmatige-intelligentiesystemen, waarbij meerdere autonome agenten op basis van grote taalmodellen (LLM) met elkaar samenwerken om complexe taken op te lossen via gestructureerde uitwisseling van instructies en antwoorden[1].

Anders gezegd bestaat een multiagentsysteem uit meerdere LLM-agenten die gezamenlijk aan een complexe gebruikersquery werken, waarbij de redenatiestappen (subtasks) worden verdeeld over agenten met verschillende 'rollen' en competenties. Het belangrijkste doel van deze aanpak is het overwinnen van de beperkingen van één enkel model bij complexe taken door middel van collectieve oplossing. Het gebruik van meerdere samenwerkende agenten is bedoeld om de kwaliteit van het redeneren, de feitelijke nauwkeurigheid en de betrouwbaarheid van het antwoord te verhogen[2]. Een belangrijk kenmerk is de strikte instructievorm: elke LLM krijgt een bepaalde rol of taak toebedeeld binnen het algemene oplossingsschema.

Methoden en architectuurpatronen

Onderzoekers hebben een aantal schema's voor multiagent prompting voorgesteld, die verschillen in de aard van de interactie tussen agenten en hun rollen.

Rolgebaseerde expertmodellering

Een of meer agenten worden aangesteld als domeinexperts met een smalle specialisatie. In een multiagentgroep kunnen verschillende agenten bijvoorbeeld verschillende kennisgebieden vertegenwoordigen (natuurkundige, scheikundige, bioloog) of verschillende stappen in het oplossingsproces (planner, uitvoerder, criticus)[1]. Deze aanpak maakt effectieve few-shot prompting mogelijk, waarbij elke expertagent demonstratievoorbeelden in zijn vakgebied ontvangt, wat de algehele prestaties verbetert.

Zelfcorrectie en kritiek (Self-reflection)

Een agent kan de rol van 'criticus' vervullen of reflecteren op de oplossingen van een andere agent of zijn eigen eerdere antwoorden. De strategie van self-reflection of self-refinement houdt in dat een LLM eerst een antwoord genereert, waarna hetzelfde of een ander model dat antwoord analyseert en fouten corrigeert[1]. Hierdoor kan het eindresultaat iteratief worden verbeterd.

Debatten tussen agenten

Een competitieve variant van multiagent prompting, waarbij een discussie of debat wordt georganiseerd tussen meerdere LLM's. In het schema LLM-Debate argumenteren twee of meer agenten over het juiste antwoord op een taak (bijvoorbeeld een wiskundig probleem) en bekritiseren ze elkaars argumenten[3]. Dit debatformaat verbetert het vermogen van het model tot logisch redeneren en verhoogt de feitelijke nauwkeurigheid van antwoorden in vergelijking met een enkelvoudige oplossing.

Planning en taakdecompositie

Eén agent vervult de functie van planner en verdeelt een complexe query in een reeks stappen of deeltaken, die vervolgens door hemzelf of door andere agenten worden opgelost. Methoden zoals ReAct en Reflexion implementeren dit principe van iteratieve planning met terugkoppeling. Een LLM genereert eerst een oplossingsplan voordat het met de uitvoering begint, wat helpt bij het omgaan met lange redeneerketens[1].

Multipersoonlijke samenwerking

In plaats van verschillende modellen kan men dezelfde LLM gebruiken, waarbij het model meerdere agenten met verschillende persoonlijke instellingen of standpunten 'speelt'. Bij de aanpak van multi-persona self-collaboration neemt één model in de loop van de dialoog achtereenvolgens meerdere rollen op zich en voert als het ware een discussie met zichzelf. Hoewel onderzoek aantoont dat afzonderlijke onafhankelijke agenten een hogere efficiëntie bieden, maakt deze methode het mogelijk een team van experts binnen één LLM te simuleren[1].

Toepassingen en resultaten

De aanpak van multiagent prompting heeft zijn effectiviteit aangetoond op een aantal gebieden waar enkelvoudige LLM's eerder met moeilijkheden werden geconfronteerd.

Wiskundig en logisch redeneren

Het gebruik van meerdere agenten verhoogt de nauwkeurigheid aanzienlijk bij taken die meerstapsinferentie vereisen (complexe rekenkunde, wiskundige bewijzen, logische puzzels). In het werk van Du et al. (2023) verbeterde de multiagent 'debat'-aanpak het resultaat ten opzichte van een enkelvoudige agent. Analyse toonde aan dat naarmate het aantal agenten dat deelneemt aan de discussie toeneemt, de nauwkeurigheid van het antwoord stijgt[3].

Wetenschappelijke en technische taken

Voor complexe vakinhoudelijke problemen (natuurkunde, scheikunde) werd de methode CoMM (Collaborative Multi-Agent, Multi-Reasoning-Path Prompting) voorgesteld, waarbij meerdere LLM-agenten met verschillende rollen (experts) parallel verschillende redeneerstrategieën toepassen. Bij testen op natuurkundetaken op collegieniveau overtrof CoMM basismethoden zoals chain-of-thought aanzienlijk, met minder fouten in formules en berekeningen[1].

Generatie en foutopsporing van code

Op het gebied van programmeren worden multiagentsystemen gebruikt om de codekwaliteit te verbeteren en het aantal fouten te verminderen. Het systeem PromptV gebruikt meerdere agenten voor het achtereenvolgens schrijven, controleren en corrigeren van Verilog-code. De verdeling van rollen (generatie, review, testen) verbeterde het vermogen van het model om fouten op te sporen en te corrigeren, waardoor het aandeel succesvol compilerende oplossingen steeg tot 96,5% op één van de benchmarks[4].

Zoeken en analyse van informatie

Multiagentsystemen zijn bijzonder nuttig voor open, slecht gestructureerde queries. Het bedrijf Anthropic ontwikkelde een multiagentmodus voor het model Claude, bedoeld voor webonderzoek. In dit systeem analyseert een leidende agent de query en genereert meerdere parallelle deeltaakagenten, die elk zoeken naar verschillende aspecten van het onderwerp. Deze architectuur was 90% effectiever bij het beantwoorden van complexe zoekvragen in vergelijking met één Claude-model[2].

Tekstclassificatie en NLP-taken

Voor NLP-taken werd principieel georiënteerde prompting (Principle-Based Prompting) ontwikkeld. Bij deze methode genereren LLM-agenten eerst een set 'principes' (oplossingsregels), waarna een finaliserende agent de beste daarvan selecteert, op basis waarvan een andere agent de classificatie uitvoert. Deze aanpak verhoogde de macro-F1-maatstaf met 1,5–19% ten opzichte van basismethoden, waarmee de kwaliteit die van klassiek leren op voorbeelden (few-shot) benaderde[5].

Beperkingen en problemen

Rekenkundige complexiteit en kosten

Het belangrijkste nadeel is de sterk toegenomen rekenbelasting. Elke agent vereist zijn eigen generatiesessie, wat leidt tot aanzienlijk token- en resourceverbruik. Volgens gegevens van Anthropic verbruikt hun systeem gemiddeld 4 keer meer tokens per dialoog, en in sommige gevallen tot 15 keer meer[2]. Dit maakt de toepassing van de aanpak alleen gerechtvaardigd voor taken met een hoge waarde.

Complexiteit van ontwerp en coördinatie

Voor een succesvolle werking is zorgvuldige technische afstemming van prompts vereist: de rol van elke agent, het berichtuitwisselingsformaat en de stopcritereria moeten duidelijk worden gedefinieerd. Anders kunnen agenten werk dupliceren, eindeloos blijven zoeken of nutteloze deeltaken aanmaken[2].

Veiligheid en betrouwbaarheid

Er ontstaan nieuwe aanvalsvectoren. Onderzoekers demonstreerden het fenomeen Prompt Infection (promptbesmetting), waarbij een kwaadaardig instructiefragment van de ene agent naar de andere wordt doorgegeven en zich door de gehele redeneerketens verspreidt als een virus. Een dergelijke LLM-to-LLM-aanval toont de kwetsbaarheid van multiagentsystemen voor verborgen injecties en manipulaties, wat de ontwikkeling van speciale beveiligingsmaatregelen vereist, zoals het labelen van de uitvoer van elke agent (LLM Tagging)[6].

Verwijzingen

  • «How we built our multi-agent research system» — gedetailleerde analyse door Anthropic
  • «More Agents Is All You Need» — wetenschappelijk artikel over de effectiviteit van agentensembles

Literatuur

  • Chen, P. et al. (2024). CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving. arXiv:2404.17729.
  • Li, J. et al. (2024). More Agents Is All You Need. arXiv:2402.05120.
  • Mi, Y. et al. (2024). PromptV: Leveraging LLM-Powered Multi-Agent Prompting for High-Quality Verilog Generation. arXiv:2412.11014.
  • Wei, P. et al. (2024). Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification. arXiv:2502.07165.
  • Lee, D.; Tiwari, A. (2024). Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems. arXiv:2410.07283.
  • Fernando, C. et al. (2023). PromptBreeder: Self-Referential Self-Improvement via Prompt Evolution. arXiv:2309.16797.
  • Wu, Q. et al. (2023). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155.
  • Liu, X. et al. (2023). AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688.
  • Li, G. et al. (2024). Multi-LLM Debate: Framework, Principles, and Interventions. PDF.
  • Du, N. et al. (2023). Improving Factuality and Reasoning in Language Models through Multi-Agent Debate. arXiv:2305.14325.

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Chen, Y. et al. «CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving». arXiv, 2024. [1]
  2. 2.0 2.1 2.2 2.3 «How we built our multi-agent research system». Anthropic. [2]
  3. 3.0 3.1 Li, G. et al. «More Agents Is All You Need». arXiv, 2024. [3]
  4. Mi, Y. et al. «PromptV: Leveraging LLM-powered Multi-Agent Prompting for High-quality Verilog Generation». ResearchGate, 2024. [4]
  5. Wei, J. et al. «Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification». arXiv, 2024. [5]
  6. Lee, K. & Tiwari, A. «Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems». OpenReview, 2024. [6]