Multi-agent prompting (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Multiagent prompting (eng. multi-agent prompting) — är en metod inom prompt-teknik och artificiella intelligenssystem, där flera autonoma agenter baserade på stora språkmodeller (LLM) interagerar med varandra för att lösa komplexa uppgifter genom ett strukturerat utbyte av instruktioner och svar[1].

Med andra ord består ett multiagentsystem av flera LLM-agenter som gemensamt arbetar med en komplex användarbegäran och fördelar resonemangssteg (subtasks) mellan agenter med olika "roller" och kompetenser. Det huvudsakliga syftet med detta tillvägagångssätt är att övervinna en enskild modells begränsningar vid komplexa uppgifter genom kollektivt problemlösande. Användningen av flera samverkande agenter syftar till att förbättra kvaliteten på resonemang, faktamässig precision och svarstillförlitlighet[2]. En viktig egenskap är den strikta instruktiviteten: varje LLM tilldelas en bestämd roll eller uppgift inom ramen för det övergripande lösningsschemat.

Metoder och arkitekturmönster

Forskare har föreslagit ett antal scheman för multiagent prompting som skiljer sig åt i fråga om agenternas interaktionskaraktär och roller.

Rollbaserad expertmodellering

En eller flera agenter utses till domänexperter med smal specialisering. I en multiagentgrupp kan till exempel olika agenter representera olika kunskapsområden (fysiker, kemist, biolog) eller olika steg i problemlösningen (planerare, utförare, kritiker)[1]. Detta tillvägagångssätt möjliggör effektiv few-shot prompting, där varje expertAgent får demonstrationsexempel inom sitt område, vilket förbättrar den övergripande prestandan.

Självkorrigering och kritik (Self-reflection)

En agent kan agera som "kritiker" eller reflektera över en annan agents lösningar eller sina egna tidigare svar. Strategin self-reflection eller self-refinement innebär att LLM först genererar ett svar, varefter samma eller en annan modell analyserar och korrigerar felen i svaret[1]. Detta möjliggör iterativ förbättring av slutresultatet.

Debatter mellan agenter

En konkurrensinriktad variant av multiagent prompting som innebär att en diskussion eller debatt organiseras mellan flera LLM. I schemat LLM-Debate argumenterar två eller fler agenter om det korrekta svaret på en uppgift (t.ex. matematisk) och kritiserar varandras argument[3]. Detta debattformat förbättrar modellens förmåga till logiskt resonemang och ökar den faktamässiga precisionen i svaren jämfört med en enskild lösning.

Planering och uppgiftsdekomposition

En agent fyller funktionen som planerare och bryter ned en komplex begäran i en sekvens av steg eller deluppgifter, som sedan löses av agenten själv eller av andra agenter. Metoder som ReAct och Reflexion implementerar denna princip om iterativ planering med återkoppling. LLM genererar först en lösningsplan innan den påbörjar genomförandet, vilket hjälper till att hantera långa resonemangkedjor[1].

Flerpersonligt samarbete

Istället för olika modeller kan man använda samma LLM och låta den "spela" flera agenter med olika personligheter eller synvinklar. I tillvägagångssättet multi-persona self-collaboration antar en modell under ett samtal successivt flera roller och för en diskussion liksom med sig själv. Även om forskning visar att separata oberoende agenter ger högre effektivitet, gör denna metod det möjligt att simulera ett expertteam inom en och samma LLM[1].

Tillämpning och resultat

Tillvägagångssättet med multiagent prompting har visat sin effektivitet inom ett antal områden där enskilda LLM tidigare stötte på svårigheter.

Matematiskt och logiskt resonemang

Användningen av flera agenter ökar märkbart precisionen vid uppgifter som kräver flerstegsslutledning (komplex aritmetik, matematiska bevis, logiska pussel). I arbetet av Du et al. (2023) förbättrade det multiagentbaserade "debatt"-tillvägagångssättet resultatet jämfört med en enskild agent. Analysen visade att i takt med att antalet agenter som deltar i diskussionen ökar, stiger svarets precision[3].

Vetenskapliga och tekniska uppgifter

För komplexa ämnesmässiga problem (fysik, kemi) föreslogs metoden CoMM (Collaborative Multi-Agent, Multi-Reasoning-Path Prompting), där flera LLM-agenter med olika roller (experter) tillämpar olika resonemangsstrategier parallellt. I tester på fysikuppgifter på högskolenivå överträffade CoMM märkbart grundläggande tillvägagångssätt som chain-of-thought och begick färre fel i formler och beräkningar[1].

Kodgenerering och felsökning

Inom programmering används multiagentsystem för att förbättra kodkvaliteten och minska antalet fel. Systemet PromptV använder flera agenter för att i tur och ordning skriva, granska och korrigera Verilog-kod. Rollfördelningen (generering, granskning, testning) förbättrade modellens förmåga att upptäcka och korrigera fel, vilket resulterade i att andelen framgångsrikt kompilerande lösningar steg till 96,5% på ett av benchmark-testen[4].

Informationssökning och -analys

Multiagentsystem är särskilt användbara för öppna, dåligt strukturerade frågor. Företaget Anthropic utvecklade ett multiagentläge för modellen Claude, avsett för webbforskning. I detta system analyserar en ledande agent begäran och genererar flera parallella deluppgiftsagenter, där var och en utför sökning kring olika aspekter av ämnet. Denna arkitektur hanterade komplexa sökfrågor 90% mer effektivt jämfört med en enskild Claude-modell[2].

Textklassificering och NLP-uppgifter

För NLP-uppgifter utvecklades principbaserad prompting (Principle-Based Prompting). I denna metodik genererar LLM-agenter först en uppsättning "principer" (lösningsregler), varefter en finaliserande agent väljer ut de bästa av dessa, på grundval av vilka en annan agent utför klassificeringen. Detta tillvägagångssätt förbättrade macro-F1-måttet med 1,5–19% jämfört med grundläggande metoder, och närmade sig i kvalitet klassisk inlärning på exempel (few-shot)[5].

Begränsningar och problem

Beräkningsmässig komplexitet och kostnader

Huvudnackdelen är den kraftigt ökade beräkningsbelastningen. Varje agent kräver sin egen genereringssession, vilket leder till betydande förbrukning av tokens och resurser. Enligt Anthropic förbrukar deras system i genomsnitt 4 gånger fler tokens per dialog, och i vissa fall upp till 15 gånger fler[2]. Detta gör att tillvägagångssättet är motiverat enbart för uppgifter med högt värde.

Komplexitet i design och koordination

För ett framgångsrikt arbete krävs noggrann prompt-teknisk konfiguration: varje agents roll, meddelandeutbytets format och stoppkriterier måste tydligt definieras. I annat fall kan agenter duplicera arbete, fastna i oändlig sökning eller skapa onödiga deluppgifter[2].

Säkerhet och tillförlitlighet

Nya attackvektorer uppstår. Forskare har demonstrerat fenomenet Prompt Infection (promptsmitta), där ett skadligt instruktionsfragment från en agent överförs till en annan och sprids längs hela resonemangskedjan likt ett virus. Denna LLM-to-LLM-attack visar multiagentsystemens sårbarhet för dolda injektioner och manipulationer, vilket kräver utveckling av särskilda skyddsåtgärder, exempelvis märkning av varje agents utdata (LLM Tagging)[6].

Källor

  • «How we built our multi-agent research system» — detaljerad genomgång från Anthropic
  • «More Agents Is All You Need» — vetenskaplig artikel om effektiviteten hos agentensembler

Litteratur

  • Chen, P. et al. (2024). CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving. arXiv:2404.17729.
  • Li, J. et al. (2024). More Agents Is All You Need. arXiv:2402.05120.
  • Mi, Y. et al. (2024). PromptV: Leveraging LLM-Powered Multi-Agent Prompting for High-Quality Verilog Generation. arXiv:2412.11014.
  • Wei, P. et al. (2024). Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification. arXiv:2502.07165.
  • Lee, D.; Tiwari, A. (2024). Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems. arXiv:2410.07283.
  • Fernando, C. et al. (2023). PromptBreeder: Self-Referential Self-Improvement via Prompt Evolution. arXiv:2309.16797.
  • Wu, Q. et al. (2023). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155.
  • Liu, X. et al. (2023). AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688.
  • Li, G. et al. (2024). Multi-LLM Debate: Framework, Principles, and Interventions. PDF.
  • Du, N. et al. (2023). Improving Factuality and Reasoning in Language Models through Multi-Agent Debate. arXiv:2305.14325.

Noter

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Chen, Y. et al. «CoMM: Collaborative Multi-Agent, Multi-Reasoning-Path Prompting for Complex Problem Solving». arXiv, 2024. [1]
  2. 2.0 2.1 2.2 2.3 «How we built our multi-agent research system». Anthropic. [2]
  3. 3.0 3.1 Li, G. et al. «More Agents Is All You Need». arXiv, 2024. [3]
  4. Mi, Y. et al. «PromptV: Leveraging LLM-powered Multi-Agent Prompting for High-quality Verilog Generation». ResearchGate, 2024. [4]
  5. Wei, J. et al. «Don't Just Demo, Teach Me the Principles: A Principle-Based Multi-Agent Prompting Strategy for Text Classification». arXiv, 2024. [5]
  6. Lee, K. & Tiwari, A. «Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems». OpenReview, 2024. [6]