Riduzione degli errori LLM

From Systems analysis Wiki
Jump to navigation Jump to search

La riduzione degli errori nei modelli linguistici di grandi dimensioni (LLM) è un insieme di metodi e tecnologie volti ad aumentare la precisione, l'affidabilità e la sicurezza dei sistemi di intelligenza artificiale basati sull'architettura transformer. Il problema degli errori, in particolare delle allucinazioni, rappresenta uno degli ostacoli principali alla diffusione su larga scala degli LLM in settori critici. Secondo ricerche condotte nel 2024–2025, la frequenza delle allucinazioni negli LLM pubblicamente disponibili varia dal 3% al 16%[1].

Tipologia degli errori

La classificazione moderna degli errori degli LLM comprende diverse categorie principali, ciascuna delle quali richiede approcci specifici di mitigazione.

Allucinazioni

Le allucinazioni consistono nella generazione di contenuti plausibili ma fattualmente errati. Secondo lo studio di Huang et al. (2023), si distinguono due tipi principali[2]:

  • Allucinazioni fattuali — discrepanza con fatti verificabili, inclusa la creazione di fatti inesistenti (fabbricazione). In uno studio del 2024, l'Università di Stanford ha scoperto che gli LLM avevano inventato più di 120 cause giudiziarie inesistenti[3].
  • Allucinazioni logiche — violazione della coerenza logica nel ragionamento.

Le statistiche del 2024 mostrano che i chatbot allucinano nel 27% dei casi, e il 46% dei testi generati contiene errori fattuali[3].

Distorsioni sistematiche (Bias)

Le distorsioni negli LLM si manifestano sotto forma di pregiudizi sociali (ad esempio, l'associazione di professioni a un determinato genere) e di differenze demografiche nelle prestazioni. Ricerche del 2024 hanno mostrato che, tra 10 modelli testati, la differenza nei punteggi per diversi gruppi demografici può raggiungere 4 punti su 10.

Tossicità

La tossicità è definita come la generazione di contenuti offensivi, dannosi o discriminatori. La metrica di tossicità varia in un ampio intervallo a seconda del modello e del contesto di utilizzo.

Metodi di riduzione degli errori

Le strategie per combattere gli errori possono essere suddivise in due grandi gruppi: metodi che modificano il modello e il processo di addestramento, e metodi applicati nella fase di inferenza.

Modifica del modello e del processo di addestramento

Fine-tuning e Instruction Tuning

Supervised Fine-Tuning (SFT) consente di adattare modelli pre-addestrati a compiti specifici. Per ridurre i costi computazionali vengono impiegati metodi di Parameter-Efficient Fine-Tuning (PEFT), come LoRA e QLoRA, che possono ridurre i costi di fine-tuning fino al 99% mantenendo l'efficacia.

Apprendimento per rinforzo basato sul feedback umano (RLHF)

RLHF è un processo in due fasi in cui prima viene addestrato un modello di ricompensa basato sulle preferenze umane, e poi l'LLM principale viene ottimizzato per generare risposte che massimizzino tale ricompensa. Il metodo ha dimostrato la sua efficacia nei modelli InstructGPT e GPT-4, migliorandone significativamente la conformità alle aspettative degli utenti[4].

Constitutional AI

Sviluppato dall'azienda Anthropic, il metodo Constitutional AI rappresenta un'alternativa all'RLHF. Anziché fare affidamento direttamente sul feedback umano, il modello viene addestrato a seguire un insieme di principi («costituzione»). Questo riduce la necessità di supervisione umana dell'80-90% e previene efficacemente la generazione di contenuti dannosi[5].

Soluzioni architetturali

  • Mixture of Experts (MoE): Architettura con attivazione sparsa che consente di aumentare significativamente la capacità del modello senza un aumento proporzionale dei costi computazionali. Si presume che GPT-4 utilizzi 8 esperti da 220 miliardi di parametri ciascuno.
  • Modifiche al meccanismo di attention: Tecniche come Grouped Query Attention (GQA) (nei modelli Llama 3) e Sparse Attention riducono la complessità computazionale e i requisiti di memoria, consentendo di elaborare contesti più lunghi.

Metodi nella fase di inferenza

Retrieval-Augmented Generation (RAG)

RAG è uno dei metodi più efficaci per ridurre gli errori fattuali. Prima di generare una risposta, il sistema accede a una base di conoscenza esterna (ad esempio, Wikipedia, documentazione aziendale, articoli scientifici), recupera le informazioni pertinenti e le trasmette al modello insieme alla richiesta originale. Questo «ancora» la risposta a fatti verificati. I sistemi RAG raggiungono il 56,8% di exact match sul benchmark TriviaQA e superano i modelli tradizionali del 60–80% nella riduzione degli errori fattuali.

Tecniche avanzate di prompting

  • Chain-of-Thought (CoT): Prompting che induce il modello a generare una catena di ragionamento passo dopo passo prima di fornire la risposta finale. Questo migliora significativamente i risultati nei compiti che richiedono ragionamento logico e calcoli matematici.
  • Chain of Draft (CoD): Evoluzione del CoT in cui il modello modifica iterativamente le bozze della propria risposta, consentendo di raggiungere una precisione paragonabile al CoT utilizzando un numero significativamente inferiore di token.

Auto-correzione intrinseca (Intrinsic Self-Correction)

Le ricerche TACL del 2024 hanno mostrato che la capacità degli LLM di auto-correggersi senza informazioni esterne è limitata. Un'auto-correzione efficace richiede generalmente l'uso di strumenti esterni, come interpreti di codice per la verifica dei calcoli o motori di ricerca per la validazione dei fatti[6].

Metodi di valutazione degli errori

Per misurare i progressi nella riduzione degli errori vengono utilizzate metriche e benchmark specializzati.

  • Metriche tradizionali: Perplexity, BLEU e ROUGE. Sono utili per valutare la fluidità e la corrispondenza degli n-grammi, ma gestiscono male la valutazione della precisione fattuale.
  • Approcci moderni:
    • FactScore scompone i testi lunghi in fatti atomici e valuta la percentuale di fatti confermati dalla base di conoscenza.
    • SAFE (Search-Augmented Factuality Evaluator) — metodo di Google che utilizza la ricerca per verificare i fatti e raggiunge il 72% di concordanza con le valutazioni umane, lavorando a un costo 20 volte inferiore.
    • TruthfulQA — benchmark focalizzato sulla capacità dei modelli di evitare la generazione di luoghi comuni errati.

Bibliografia

  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
  • Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
  • Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
  • Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
  • Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.

Note

  1. «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
  2. Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
  3. 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
  4. OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
  5. Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
  6. «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).