LLaMA (Meta AI) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — οικογένεια μεγάλων γλωσσικών μοντέλων (LLM) με κατά κύριο λόγο ανοιχτό πηγαίο κώδικα, που αναπτύσσεται από το ερευνητικό τμήμα Meta AI. Τα μοντέλα LLaMA βασίζονται σε τροποποιημένη αρχιτεκτονική transformer και προσανατολίζονται στην υψηλή υπολογιστική αποδοτικότητα, στη δημοκρατικοποίηση της πρόσβασης στις προηγμένες τεχνολογίες AI και στην εύκολη προσαρμογή σε εξειδικευμένες εργασίες. Η οικογένεια εξελίχθηκε από την αρχική ερευνητική έκδοση LLaMA 1 (Φεβρουάριος 2023) έως τα πολυτροπικά μοντέλα LLaMA 4 (προγραμματισμένη κυκλοφορία το 2026).

Ονομασία

Το αρκτικόλεξο LLaMA αναλύεται ως Large Language Model Meta AI (Μεγάλο Γλωσσικό Μοντέλο Meta AI).

  • Large Language Model — υπογραμμίζει την κλίμακα των μοντέλων, οι παράμετροι των οποίων μετρώνται από δισεκατομμύρια έως τρισεκατομμύρια.
  • Meta AI — υποδηλώνει τον προγραμματιστή, την ερευνητική ομάδα της Meta.

Ιστορία δημιουργίας

Η ανάπτυξη του LLaMA ξεκίνησε στα τέλη του 2022 ως στρατηγική απάντηση της Meta στην επιτυχία του ChatGPT της OpenAI. Ο Mark Zuckerberg συγκρότησε διεπιστημονική ομάδα που περιλάμβανε ερευνητές από το εργαστήριο FAIR (Facebook AI Research). Κεντρικό ρόλο στη φιλοσοφία του έργου διαδραμάτισε ο Yann LeCun, επικεφαλής του FAIR, ο οποίος από το 2013 τηρούσε την αρχή της πλήρους διαφάνειας όλων των ερευνών του εργαστηρίου.

Η πρώτη έκδοση, LLaMA 1, κυκλοφόρησε τον Φεβρουάριο του 2023 με ερευνητική άδεια. Λίγο μετά την κυκλοφορία, τον Μάρτιο του 2023, τα βάρη του μοντέλου διέρρευσαν στο διαδίκτυο μέσω BitTorrent. Το γεγονός αυτό, αντίθετα με τους φόβους, δεν ανέστειλε αλλά αντίθετα τόνωσε την ανάπτυξη του έργου, καθώς έδωσε τη δυνατότητα σε ανεξάρτητους ερευνητές και ενθουσιώδεις από όλο τον κόσμο να πειραματιστούν με το μοντέλο. Ως αποτέλεσμα, εμφανίστηκαν δεκάδες χιλιάδες παράγωγα μοντέλα στην πλατφόρμα Hugging Face. Οι επόμενες εκδόσεις, ξεκινώντας από το LLaMA 2, κυκλοφόρησαν ήδη με εμπορική άδεια[1], εδραιώνοντας τη θέση του LLaMA ως βασικού παίκτη στην αγορά ανοιχτών μοντέλων AI.

Εξέλιξη μοντέλων και χρονολόγιο κυκλοφοριών

Χρονολόγιο ανάπτυξης των μοντέλων LLaMA
Έκδοση Ημερομηνία κυκλοφορίας Εύρος παραμέτρων Βασικές καινοτομίες και χαρακτηριστικά
LLaMA 1 Φεβρουάριος 2023 7B – 65B Βασική αρχιτεκτονική (RMSNorm, SwiGLU, RoPE). Εκπαίδευση σε 1,4 τρισ. tokens. Παράθυρο context 2048 tokens. Ερευνητική άδεια.
LLaMA 2 Ιούλιος 2023 7B – 70B Fine-tuning για διαλόγους (RLHF). Εισαγωγή Grouped-Query Attention (GQA). Παράθυρο context 4096 tokens. Πρώτη εμπορική άδεια.
Code Llama Αύγουστος 2023 7B – 70B Εξειδικευμένη έκδοση για κώδικα. Fine-tuning σε 500 δισ. tokens κώδικα. Παραλλαγές: βασική, εξειδικευμένη Python, instruction-tuned.
LLaMA 3 Απρίλιος 2024 8B, 70B Εκπαίδευση σε 15 τρισ. tokens. Βελτιωμένος tokenizer με λεξιλόγιο 128 χιλ. tokens. Υψηλή απόδοση (82% στο MMLU).
LLaMA 3.1 Ιούλιος 2024[2] 8B, 70B, 405B Μοντέλο αιχμής 405B με απόδοση ισάξια του GPT-4o. Παράθυρο context έως 128 χιλ. tokens. Προστέθηκε δυνατότητα επεξεργασίας εικόνων.
LLaMA 4 (σχέδιο: Απρίλιος 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Αρχιτεκτονική Mixture-of-Experts (MoE). Εγγενής πολυτροπικότητα (κείμενο, εικόνες, βίντεο). Παράθυρο context έως 10 εκατ. tokens.

Αρχιτεκτονική

Το LLaMA χρησιμοποιεί αρχιτεκτονική αυτοπαλίνδρομου transformer-decoder, εισάγοντας ωστόσο μια σειρά βασικών βελτιώσεων που αυξάνουν την υπολογιστική αποδοτικότητα και την ποιότητα του παραγόμενου κειμένου:

  • Pre-normalization (Προκανονικοποίηση). Η κανονικοποίηση εφαρμόζεται στην είσοδο κάθε υποστρώματος του transformer, όχι στην έξοδο. Αυτή η προσέγγιση σταθεροποιεί την εκπαίδευση πολύ βαθιών δικτύων και αποτρέπει προβλήματα με τις κλίσεις.
  • RMSNorm (Root Mean Square Layer Normalization). Αντί για το τυπικό LayerNorm χρησιμοποιείται το RMSNorm. Αυτή η τεχνική κανονικοποίησης εξαλείφει την πράξη αφαίρεσης του μέσου όρου, επιταχύνοντας τους υπολογισμούς κατά 10–50% διατηρώντας παράλληλα τη σταθερότητα.
  • SwiGLU (Swish-Gated Linear Unit). Ως συνάρτηση ενεργοποίησης αντί για ReLU ή GELU χρησιμοποιείται το SwiGLU. Αυτός ο μηχανισμός πύλης (gating mechanism) δημιουργεί ομαλότερη ροή κλίσεων και βελτιώνει την ποιότητα του μοντέλου.
  • RoPE (Rotary Position Embeddings, Περιστροφικά Θεσιακά Embeddings). Για την κωδικοποίηση θέσεων tokens χρησιμοποιούνται σχετικά θεσιακά embeddings RoPE, που επιτρέπουν στο μοντέλο να εξωπολλαπλασιάζεται καλύτερα σε ακολουθίες μεγαλύτερες από αυτές που χρησιμοποιήθηκαν κατά την εκπαίδευση.
  • GQA (Grouped-Query Attention). Εισαχθέν στο LLaMA 2, αυτή η τεχνική αποτελεί βελτιστοποίηση της πολυκέφαλης προσοχής, που μειώνει σημαντικά τις απαιτήσεις μνήμης και επιταχύνει τη δημιουργία κειμένου.
  • Mixture-of-Experts (MoE) (προγραμματισμένο στο LLaMA 4). Αρχιτεκτονική που διαιρεί τις παραμέτρους του μοντέλου σε «εξειδικευμένα» υποδίκτυα, ενεργοποιώντας μόνο ένα μικρό μέρος τους για κάθε αίτημα. Αυτό μειώνει δραστικά το υπολογιστικό κόστος της inference.

Διαμορφώσεις LLaMA 1

Αρχιτεκτονικές παράμετροι των μοντέλων LLaMA 1
Μοντέλο Παράμετροι Διάσταση κρυφής κατάστασης Αρ. στρωμάτων Αρ. κεφαλών προσοχής Όγκος δεδομένων εκπαίδευσης
7B 6.7B 4096 32 32 1.0T tokens
13B 13.0B 5120 40 40 1.0T tokens
33B 32.5B 6656 60 52 1.4T tokens
65B 65.2B 8192 80 64 1.4T tokens

Δεδομένα εκπαίδευσης

Ο όγκος των εκπαιδευτικών σωμάτων αυξήθηκε από 1,4 τρισ. tokens για το LLaMA 1 σε 15 τρισ. για το LLaMA 3. Για την εκπαίδευση χρησιμοποιούνται δημόσια διαθέσιμες πηγές, συμπεριλαμβανομένων του Common Crawl (αποτελεί έως 67% των δεδομένων), C4, GitHub, Wikipedia, Books, ArXiv και Stack Exchange. Για το LLaMA 3 χρησιμοποιήθηκαν επίσης δεδομένα υψηλής ποιότητας από ιδιωτικές πηγές.

Απόδοση και σύγκριση

  • Σε benchmark: Το μοντέλο LLaMA 3.1 (405B) εμφανίζει αποτελέσματα κοντά στο GPT-4o: στο τεστ MMLU επιτυγχάνει 88,6%, υστερώντας του GPT-4o κατά μόλις 0,1 ποσοστιαία μονάδα. Στην εργασία δημιουργίας κώδικα HumanEval το LLaMA 3.1 σκοράρει 89% (GPT-4o — 90,2%).
  • Παραμετρική αποδοτικότητα: Τα μοντέλα LLaMA με μικρότερο αριθμό παραμέτρων συχνά ξεπερνούν μεγαλύτερα μοντέλα ανταγωνιστών. Για παράδειγμα, το LLaMA 1 (13B) ξεπέρασε το GPT-3 (175B) στις περισσότερες δοκιμές.
  • Κόστος: Με τοπική φιλοξενία, το κόστος inference του LLaMA μπορεί να είναι έως 50 φορές χαμηλότερο σε σύγκριση με τη χρήση ιδιόκτητων API, καθιστώντας την τεχνολογία προσιτή για μικρές και μεσαίες επιχειρήσεις.

Αδειοδότηση

  • Το LLaMA 1 διανεμήθηκε με μη εμπορική ερευνητική άδεια με πρόσβαση κατόπιν αιτήματος.
  • Το LLaMA 2 και οι μεταγενέστερες εκδόσεις διανέμονται με την άδεια Llama Community License, η οποία επιτρέπει εμπορική χρήση και τροποποίηση. Ωστόσο, η άδεια περιέχει περιορισμούς: εταιρείες με περισσότερους από 700 εκατ. ενεργούς χρήστες ανά μήνα οφείλουν να λαμβάνουν ειδική άδεια από τη Meta. Αυτό προκαλεί συζητήσεις σχετικά με το εάν το LLaMA αποτελεί πλήρως ανοιχτό μοντέλο.

Εφαρμογές

Τα μοντέλα LLaMA έχουν ενσωματωθεί στα προϊόντα χιλιάδων εταιρειών και χρησιμοποιούνται σε διάφορους τομείς:

  • Εταιρικός τομέας: Η Zoom χρησιμοποιεί το LLaMA στο AI Companion για περιλήψεις συναντήσεων· η Shopify — για επεξεργασία 40–60 εκατ. αιτημάτων την ημέρα για εμπλουτισμό μεταδεδομένων προϊόντων· η Instacart — στον εσωτερικό βοηθό Ava.
  • Επιστήμη και κοινωνία: Το Meditron (προσαρμογή του LLaMA) χρησιμοποιείται για ιατρική διάγνωση σε περιοχές με περιορισμένους πόρους.
  • Κρατικός τομέας και βιομηχανία: Η Meta συνήψε συνεργασίες με τις Lockheed Martin και Palantir. Η NASA χρησιμοποιεί το LLaMA 3 στον Διεθνή Διαστημικό Σταθμό ως offline βοηθό για την εκτέλεση κρίσιμων επιχειρήσεων χωρίς επικοινωνία με τη Γη.

Περιορισμοί και κριτική

  • Μεροληψία και ασφάλεια: Ανεξάρτητοι έλεγχοι δείχνουν ότι τα μοντέλα LLaMA, παρά τα μέτρα ασφαλείας, ενδέχεται να αναπαράγουν επιβλαβή στερεότυπα. Η διαρροή των βαρών του LLaMA 1 όξυνε τα ερωτήματα σχετικά με την ενδεχόμενη κακόβουλη χρήση της τεχνολογίας.
  • Κενά γνώσης: Σε εξαιρετικά εξειδικευμένους τομείς, το LLaMA μπορεί να εμφανίζει κενά. Για παράδειγμα, η ακρίβεια στην ιατρική δοκιμασία nephSAP ήταν 17–30% έναντι 73% του GPT-4.
  • Κατανάλωση ενέργειας: Η εκπαίδευση μεγάλων μοντέλων απαιτεί τεράστιους πόρους. Η εκπαίδευση του LLaMA 1 κατανάλωσε 2.638 MWh, ισοδύναμο με εκπομπές 1.015 τόνων CO₂.

Μέλλον

Η Meta σχεδιάζει να επενδύσει έως 65 δισεκατομμύρια δολάρια σε υποδομή AI έως το 2025. Σε ανάπτυξη βρίσκεται το μοντέλο LLaMA 4 Behemoth με 2 τρισεκατομμύρια παραμέτρους, που θα υποστηρίζει περισσότερες από 200 γλώσσες και θα αποκτήσει βαθιά ενσωμάτωση με τα προϊόντα του metaverse.

Βιβλιογραφία

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Σημειώσεις

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Δείτε επίσης

  • GPT
  • Μεγάλα γλωσσικά μοντέλα
  • Transformer (αρχιτεκτονική νευρωνικού δικτύου)