Gemini (Google) (EL)
Google Gemini — είναι μια οικογένεια πολυτροπικών μεγάλων γλωσσικών μοντέλων (LLM), που αναπτύσσεται από το ερευνητικό τμήμα Google DeepMind. Τα μοντέλα Gemini, που παρουσιάστηκαν για πρώτη φορά τον Δεκέμβριο του 2023, βασίζονται στην αρχιτεκτονική νευρωνικών δικτύων transformer με εγγενή υποστήριξη επεξεργασίας και δημιουργίας δεδομένων διαφόρων τροπικοτήτων, συμπεριλαμβανομένων κειμένου, εικόνων, ήχου, βίντεο και κώδικα.
Από τον Φεβρουάριο του 2026, η τρέχουσα γενιά είναι η σειρά Gemini 3.x. Η εξέλιξη της αρχιτεκτονικής κατευθύνεται στην ενσωμάτωση μηχανισμών κλιμακούμενης λογικής κατά τον χρόνο inference (inference-time scaling) και στη βελτιστοποίηση των μοντέλων για χρήση σε αυτόνομα αγεντικά συστήματα (Agentic AI). Η εφαρμογή Gemini έχει περισσότερους από 750 εκατομμύρια ενεργούς χρήστες μηνιαίως.
Ονομασία και φιλοσοφία
Το όνομα "Gemini" (από τα λατινικά — Δίδυμοι) συμβολίζει την ένωση δύο κορυφαίων ερευνητικών ομάδων της Google — Google Brain και DeepMind — για τη δημιουργία αυτού του έργου. Ο Jeff Dean, συντεχνικός διευθυντής της Google DeepMind, το επιβεβαίωσε στο επίσημο blog (Μάιος 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Το έργο είχε αρχικά κωδικό όνομα «Titan»· το όνομα «Gemini» προτάθηκε από τον Dean τον Απρίλιο του 2023 — τον ίδιο μήνα που πραγματοποιήθηκε η επίσημη συγχώνευση της Google Brain και της DeepMind. Το όνομα παραπέμπει επίσης στο διαστημικό πρόγραμμα της NASA «Gemini» (1965–1968), ο ρόλος του οποίου στην προετοιμασία του προγράμματος «Apollo» βρήκε απήχηση στην ομάδα ανάπτυξης.
Βασικό χαρακτηριστικό και φιλοσοφική βάση του Gemini είναι η εγγενής πολυτροπικότητα. Σε αντίθεση με πολλά προηγούμενα μοντέλα, όπου οι πολυτροπικές δυνατότητες προστίθεντο πάνω σε υπάρχουσα κειμενική βάση, το Gemini σχεδιάστηκε από την αρχή για την ταυτόχρονη κατανόηση, επεξεργασία και συνδυασμό διαφορετικών τύπων πληροφοριών. Η τεχνική έκθεση Gemini 1.0 (arXiv:2312.11805) επιβεβαιώνει ότι το μοντέλο «trained jointly across image, audio, video, and text data». Αυτό επιτρέπει στο μοντέλο όχι απλώς να μεταφράζει δεδομένα μεταξύ τροπικοτήτων, αλλά να διαμορφώνει βαθύτερη, ολιστική κατανόησή τους.
Αρχιτεκτονική και βασικές τεχνολογίες
Η επιτυχία και οι δυνατότητες των μοντέλων Gemini καθορίζονται από μια σειρά θεμελιωδών αρχιτεκτονικών αποφάσεων. Η Google δεν δημοσιεύει πλήρη χαμηλού επιπέδου σχεδίαση όλων των εσωτερικών συνιστωσών του Gemini, ωστόσο οι ανοιχτές πηγές επιτρέπουν να προσδιοριστεί η κατηγορία αρχιτεκτονικής: όλα τα μοντέλα της οικογένειας 1.5 και άνω είναι sparse mixture-of-experts transformer-based models με εγγενή πολυτροπική υποστήριξη (επιβεβαιωμένο από το model card του Gemini 2.5 Flash).
Εγγενής πολυτροπική αρχιτεκτονική
Η αρχιτεκτονική Gemini βασίζεται στην έννοια της πρώιμης συγχώνευσης (early fusion). Οι εικονοστοιχειακές επιφάνειες (pixel patches) εικόνων, τα χρονικά καρέ βίντεο, τα φωνογράμματα ήχου και τα token κειμένου προβάλλονται σε ένα ενιαίο λανθάνον χώρο. Η τεχνική έκθεση του Gemini 2.5 περιγράφει αυτή την προσέγγιση ως «Unified Multimodal Token Interleaving». Δεδομένου ότι όλα τα token διαφόρων τροπικοτήτων επεξεργάζονται σε μια κοινή ακολουθία, οι τυπικοί μηχανισμοί αυτοπροσοχής (self-attention) εξασφαλίζουν φυσικά διασταυρούμενη ενσωμάτωση δεδομένων από διαφορετικές τροπικότητες σε κάθε στρώμα. Τα ηχητικά σήματα επεξεργάζονται από εξειδικευμένους κωδικοποιητές απευθείας από το ηχητικό κύμα (waveform), διατηρώντας τα ακουστικά χαρακτηριστικά (τονισμός, χροιά, θόρυβος φόντου) που χάνονται κατά τη χρήση ενδιάμεσων συστημάτων μεταγραφής Speech-to-Text.
Για την κατηγορία transformer η βασική πράξη είναι ο μηχανισμός προσοχής:
όπου — ο πίνακας ερωτημάτων, — κλειδιών, — τιμών, και — η διάσταση των κλειδιών.
Αραιό μείγμα εμπειρογνωμόνων (Sparse MoE)
Από την έκδοση 1.5 και μετά, τα μοντέλα Gemini χρησιμοποιούν την αρχιτεκτονική Sparse Mixture-of-Experts (MoE). Το Gemini 1.0 χρησιμοποιούσε πυκνό (dense) transformer· η μετάβαση στο MoE περιγράφεται ρητά στην τεχνική έκθεση 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».
Στην αρχιτεκτονική MoE τα τυπικά πλήρως συνδεδεμένα στρώματα (Feed-Forward Networks) αντικαθίστανται από ένα σύνολο εξειδικευμένων υποδικτύων — «εμπειρογνωμόνων». Για ένα εισερχόμενο token η έξοδος διαμορφώνεται ως σταθμισμένο άθροισμα εξόδων ενεργών εμπειρογνωμόνων (, όπου — ο συνολικός αριθμός εμπειρογνωμόνων):
όπου — η μη γραμμική συνάρτηση του -ου εμπειρογνώμονα, — το σύνολο δεικτών επιλεγμένων υποδικτύων, και το βάρος δρομολόγησης υπολογίζεται από μια εκπαιδευμένη συνάρτηση δρομολόγησης (learned routing function) με εφαρμογή Softmax πάνω από τις μεγαλύτερες τιμές.
Αυτή η προσέγγιση επιτρέπει σημαντική αύξηση της συνολικής παραμετρικής χωρητικότητας του μοντέλου, διατηρώντας το υπολογιστικό κόστος (FLOPs) σε χαμηλό επίπεδο, καθώς για κάθε token ενεργοποιείται μόνο ένα υποσύνολο παραμέτρων. Η Google δεν αποκάλυψε τον πραγματικό αριθμό παραμέτρων των μοντέλων Gemini.
Μεγάλο πλαίσιο και «Εκμάθηση στο πλαίσιο»
Το Gemini 1.5 πραγματοποίησε돌 breakthrough αυξάνοντας το μέγεθος του πλαισίου σε 1 εκατομμύριο token σε λειτουργία production (με πειραματικές δοκιμές έως 10 εκατομμύρια token). Αυτό είναι κατά τάξη μεγέθους περισσότερο από τα προηγούμενα μοντέλα (π.χ. GPT-4 Turbo με 128 χιλ. token). Η Google ανέφερε αποτέλεσμα 99% στη δοκιμή Needle In A Haystack με μήκος πλαισίου 1 εκατ. token. Για τις επόμενες γενιές, το long context καθιερώθηκε ως ένα από τα βασικά χαρακτηριστικά της σειράς. Ένα τέτοιο εκτεταμένο πλαίσιο επιτρέπει στο μοντέλο:
- Ανάλυση ολόκληρων βιβλίων, πολύωρων βίντεο (έως 3 ώρες) ή μεγάλων βάσεων κώδικα εντός ενός μόνο ερωτήματος.
- Εκτέλεση «εκμάθησης στο πλαίσιο» (in-context learning) σε τεράστιους όγκους δεδομένων που παρέχονται στο prompt, επιτρέποντας εξαιρετικά προσαρμοσμένες απαντήσεις χωρίς την ανάγκη fine-tuning.
«Μοντέλα σκέψης» και κλιμάκωση υπολογισμών κατά τον inference
Από το Gemini 2.5 και μετά, η Google ορίζει το thinking ως ξεχωριστή λειτουργία των μοντέλων. Η επίσημη τεκμηρίωση το ορίζει ως εσωτερική υπολογιστική διαδικασία που βελτιώνει τον πολυβηματικό σχεδιασμό και τη συλλογιστική. Τα μοντέλα έκδοσης 2.5 (που περιγράφονται ως «thinking models») είναι ικανά να δημιουργούν και να αξιολογούν εσωτερικά ενδιάμεσα βήματα συλλογισμού πριν δώσουν την τελική απάντηση. Αυτό βελτιώνει σημαντικά την ακρίβεια σε σύνθετα λογικά και μαθηματικά προβλήματα.
Είναι σημαντικό να διακρίνουμε δύο μηχανισμούς:
- Ενσωματωμένη σκέψη (Thinking): Βασική λειτουργία για τα μοντέλα σειράς 2.5 και 3, που δημιουργεί μια κρυφή αλυσίδα συλλογισμού (Chain-of-Thought). Το API μπορεί να επιστρέφει thought summaries — σύντομες περιλήψεις εσωτερικών συλλογισμών και όχι ολόκληρη τη ροή των «ακατέργαστων σκέψεων». Από το μοντέλο 3.1 Pro, ο προϋπολογισμός σκέψης ρυθμίζεται από την παράμετρο
thinking_levelμε τιμές από Low έως Max. - Deep Think: Ξεχωριστή πειραματική εκτεταμένη λειτουργία συλλογισμού, που χρησιμοποιεί παράλληλη δημιουργία υποθέσεων και απαιτεί σημαντικά μεγαλύτερους υπολογιστικούς πόρους. Ανακοινώθηκε στο Google I/O στις 20 Μαΐου 2025 και ανοίχτηκε στους συνδρομητές AI Ultra την 1η Αυγούστου 2025. Το Deep Think δεν πρέπει να ταυτίζεται με τον βασικό μηχανισμό thinking.
Αγεντικές δυνατότητες (Agentic Capabilities)
Από την έκδοση 2.0, το Gemini μπορεί να αλληλεπιδρά με τον εξωτερικό κόσμο: να καλεί εργαλεία, να πραγματοποιεί αναζήτηση στο Google, να εκτελεί κώδικα και να διαχειρίζεται στοιχεία διεπαφής χρήστη. Η Google τοποθέτησε ρητά το Gemini 2.0 ως μοντέλο για τη «νέα αγεντική εποχή» (agentic era) με εγγενή υποστήριξη tool use.
Έως τον Φεβρουάριο του 2026, το Gemini API περιλαμβάνει επίσημα κατοχυρωμένο στρώμα αγεντικών δυνατοτήτων με υποστήριξη εργαλείων: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, καθώς και Live API για αμφίδρομη αλληλεπίδραση σε πραγματικό χρόνο.
Εξέλιξη των μοντέλων Gemini
Η οικογένεια Gemini εξελίσσεται με εξαιρετικά γρήγορους ρυθμούς: κατά την περίοδο Δεκεμβρίου 2023 έως Φεβρουαρίου 2026 κυκλοφόρησαν τέσσερις κύριες γενιές μοντέλων.
Gemini 1.0 (Δεκέμβριος 2023)
Η πρώτη γενιά, που έθεσε τα θεμέλια της εγγενούς πολυτροπικότητας. Παρουσιάστηκε δημόσια στις 6 Δεκεμβρίου 2023.
- Εκδόσεις: Ultra (ναυαρχίδα για τις πιο σύνθετες εργασίες), Pro (γενικής χρήσης μοντέλο) και Nano (συμπαγές για φορητές συσκευές· υποδιαιρέθηκε σε Nano-1 με 1,8 δισ. παραμέτρους και Nano-2 με 3,25 δισ.).
- Πλαίσιο περιβάλλοντος: 32 768 token για όλες τις εκδόσεις.
- Επιτεύγματα: Το Gemini 1.0 Ultra έγινε το πρώτο μοντέλο που επέτυχε και ξεπέρασε το επίπεδο ανθρώπινου εμπειρογνώμονα στο benchmark MMLU με αποτέλεσμα 90,04% (χρησιμοποιώντας την τεχνική CoT@32 — αλυσίδα συλλογισμού με 32 δείγματα και ψηφοφορία πλειοψηφίας· με τυπικό 5-shot prompting το αποτέλεσμα ήταν περίπου 83,7%). Επέδειξε SOTA αποτελέσματα σε 30 από 32 ακαδημαϊκά benchmark.
- Διακοπή υποστήριξης: Το Gemini 1.0 Pro κηρύχθηκε απαρχαιωμένο στις 18 Φεβρουαρίου 2025.
Gemini 1.5 (Φεβρουάριος — Μάιος 2024)
Ανατροπή στο μήκος πλαισίου και στην αποδοτικότητα.
- Αρχιτεκτονική: Μετάβαση από πυκνό transformer σε Mixture-of-Experts (MoE).
- Πλαίσιο περιβάλλοντος: Έως 1 εκατομμύριο token σε production (2 εκατομμύρια — μέσω waitlist για το 1.5 Pro, ανακοινώθηκε τον Μάιο 2024 στο Google I/O).
- Εκδόσεις: 1.5 Pro (ανακοινώθηκε τον Φεβρουάριο 2024· με ποιότητα στο επίπεδο του 1.0 Ultra με σημαντικά μικρότερο κόστος) και 1.5 Flash (ελαφρύτερη και γρηγορότερη έκδοση, προστέθηκε τον Μάιο 2024).
- Διακοπή υποστήριξης: Όλα τα μοντέλα Gemini 1.5 (Pro, Flash, Flash-8B) αποσύρθηκαν από τη λειτουργία 29 Σεπτεμβρίου 2025.
Gemini 2.0 (Δεκέμβριος 2024 — Φεβρουάριος 2025)
Μετάβαση στη «αγεντική εποχή».
- Χρονολόγιο: 11 Δεκεμβρίου 2024 — ανακοίνωση του 2.0 Flash Experimental (πολυτροπική είσοδος, κειμενική έξοδος)· 5 Φεβρουαρίου 2025 — ευρεία διαθεσιμότητα (GA) του 2.0 Flash, κυκλοφορία του 2.0 Pro Experimental και του 2.0 Flash-Lite.
- Βασικές καινοτομίες: Ενσωματωμένες αγεντικές δυνατότητες (tool use), εγγενής δημιουργία εικόνων και ήχου (αρχικά σε περιορισμένη λειτουργία για early-access συνεργάτες), εστίαση σε αγεντικά σενάρια.
- Πλαίσιο περιβάλλοντος: Έως 2 εκατ. token (2.0 Pro)· έως 1 εκατ. token (2.0 Flash-Lite).
- Διακοπή υποστήριξης: Τα μοντέλα 2.0 Flash και Flash-Lite έχουν προγραμματιστεί να αποσυρθούν 1 Ιουνίου 2026.
Gemini 2.5 (Μάρτιος — Ιούνιος 2025)
Το πρώτο «μοντέλο σκέψης» (thinking model) με ρυθμιζόμενο προϋπολογισμό συλλογισμού.
- Χρονολόγιο: 25 Μαρτίου 2025 — ανακοίνωση του 2.5 Pro Experimental· 17 Απριλίου — 2.5 Flash (το πρώτο πλήρως υβριδικό reasoning μοντέλο με εναλλάξιμη λειτουργία σκέψης)· 20 Μαΐου (Google I/O) — ενημερώσεις 2.5 Pro και Flash, ανακοίνωση Deep Think· 17 Ιουνίου 2025 — ταυτόχρονο GA για 2.5 Pro και 2.5 Flash· την ίδια μέρα — προεπισκόπηση 2.5 Flash-Lite (GA 22 Ιουλίου). 1 Αυγούστου — το Deep Think ανοίχτηκε στους συνδρομητές AI Ultra.
- Βασικές καινοτομίες: Ενσωματωμένος μηχανισμός «σκέψης» (thinking) με ρυθμιζόμενους προϋπολογισμούς· Deep Think ως ξεχωριστή εκτεταμένη λειτουργία. SOTA αποτελέσματα σε σύνθετα μαθηματικά, λογικά και προγραμματιστικά benchmark (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% χωρίς εργαλεία).
- Πλαίσιο περιβάλλοντος: 1 εκατομμύριο token στην είσοδο, έως 64 000 token στην έξοδο. Η υποσχεμένη επέκταση σε 2 εκατ. token για το 2.5 Pro δεν επιβεβαιώθηκε ως υλοποιημένη κατά τον κύκλο ζωής του μοντέλου.
- Εξειδικευμένες παραλλαγές: Gemini 2.5 Flash Image (κωδικό όνομα «Nano Banana», εμφανίστηκε ανώνυμα στο Arena στις 12 Αυγούστου, κυκλοφόρησε επίσημα 26 Αυγούστου 2025 — έγινε viral χάρη σε φωτορεαλιστικά «3D figurines», προσέλκυσε 10 εκατ. νέους χρήστες)· Computer Use Preview (7 Οκτωβρίου 2025, βάσει 2.5 Pro)· μοντέλα Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
- Τεχνική έκθεση: Η συνολική έκθεση Gemini 2.X δημοσιεύτηκε στο arXiv στις 7 Ιουλίου 2025 (arXiv:2507.06261), περιέχει περισσότερους από 3 300 συγγραφείς και καλύπτει τα μοντέλα 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite.
Gemini 3.x (Νοέμβριος 2025 — Φεβρουάριος 2026)
Η τρίτη γενιά σηματοδότησε τη μετάβαση από τη βασική δημιουργία σε εκτεταμένες αγεντικές διαδικασίες (agentic workflows) και την επίλυση διεπιστημονικών επιστημονικών προβλημάτων.
- Gemini 3 Pro (18 Νοεμβρίου 2025): Ανακοινώθηκε από τον Διευθύνοντα Σύμβουλο της Alphabet Sundar Pichai και τον επικεφαλής της DeepMind Demis Hassabis ως «το πιο ευφυές μοντέλο της Google». Το πρώτο μοντέλο Gemini που αναπτύχθηκε στο Google Search την ημέρα κυκλοφορίας. Έγινε το πρώτο μοντέλο που ξεπέρασε το όριο 1500 Elo στο LMArena (1501 κατά την εκκίνηση). Αποτελέσματα: GPQA Diamond — 91,9%· SWE-bench Verified — 76,2%· Humanity's Last Exam — 37,5% (χωρίς εργαλεία)· SimpleQA — 72,1%.
- Gemini 3 Flash (17 Δεκεμβρίου 2025): Έγινε το προεπιλεγμένο μοντέλο στην εφαρμογή Gemini. Σε τιμή $0,50 / 1 εκατ. εισερχόμενα token, ξεπέρασε το 3 Pro στο SWE-bench Verified (78%) χρησιμοποιώντας 30% λιγότερα token για εργασίες συλλογισμού. GPQA Diamond — 90,4%· HLE — 33,7%.
- Gemini 3.1 Pro (19 Φεβρουαρίου 2026): Κορυφαίο μοντέλο κατά την ημερομηνία δημοσίευσης. Η πρώτη «σταδιακή» έκδοση (.1 αντί των προηγούμενων .5). Βασικό αποτέλεσμα — ARC-AGI-2: 77,1% (περισσότερο από διπλάσιο σε σχέση με 31,1% του 3 Pro). AIME 2025 — 91,2%· GPQA Diamond — 94,3%· SWE-bench Verified — 80,6%. Εισήχθη νέο επίπεδο σκέψης MEDIUM μέσω της παραμέτρου
thinking_level. Εξειδικευμένο endpointgemini-3.1-pro-preview-customtoolsγια εργασία με bash terminal και προσαρμοσμένες συναρτήσεις. Αντιμετωπίστηκε το πρόβλημα αποκοπής εξόδου σε μεγάλες γενέσεις. Κανάλια: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM. - Gemini 3 Deep Think (ενημέρωση 12 Φεβρουαρίου 2026): Σημαντική ενημέρωση εξειδικευμένης λειτουργίας «σκέψης». Ξεπέρασε τα όρια των μαθηματικών και του προγραμματισμού: αποτελέσματα επιπέδου χρυσών μεταλλίων σε διεθνείς ολυμπιάδες φυσικής (IPhO) και χημείας (IChO) 2025· ARC-AGI-2 — 84,6%· Humanity's Last Exam — 48,4%· CMT-Benchmark (θεωρητική φυσική συμπυκνωμένης ύλης) — 50,5%· Codeforces Elo — 3455. Βάσει Deep Think δημιουργήθηκε ο ερευνητικός πράκτορας Aletheia, που επέλυσε αυτόνομα αρκετά ανοιχτά προβλήματα από τη βάση του Erdős (συμπεριλαμβανομένου του προβλήματος Erdős-1051).
Συγκεντρωτικός πίνακας γενεών Gemini
| Γενιά | Έτος κυκλοφορίας | Βασικές εκδόσεις | Μέγ. πλαίσιο περιβάλλοντος | Βασικές αρχιτεκτονικές καινοτομίες και βελτιώσεις |
|---|---|---|---|---|
| Gemini 1.0 | 2023 | Ultra, Pro, Nano | 32 768 token | Εγγενής πολυτροπικότητα εξαρχής· πυκνός transformer· υπεροχή έναντι ανθρώπου στο MMLU (90,04% CoT@32). |
| Gemini 1.5 | 2024 | Pro, Flash | 1 000 000 token (2 εκατ. μέσω waitlist) | Αρχιτεκτονική Mixture-of-Experts (MoE)· επαναστατική αύξηση πλαισίου· 99% Needle In A Haystack. |
| Gemini 2.0 | 2024–2025 | Pro, Flash, Flash-Lite | 1 000 000 — 2 000 000 token | Εποχή «agentic AI»: εγγενής ενσωμάτωση εργαλείων, δημιουργία εικόνων και ήχου, Live API. |
| Gemini 2.5 | 2025 | Pro, Flash, Flash-Lite | 1 000 000 token (είσοδος), 64 000 (έξοδος) | «Μοντέλο σκέψης» (thinking)· ρυθμιζόμενοι προϋπολογισμοί συλλογισμού· Deep Think· δημιουργία εικόνων (Nano Banana)· Computer Use. |
| Gemini 3.x | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1 000 000 token | Αγεντικά workflows· παράμετρος thinking_level· ανατροπή στο ARC-AGI-2 και σε επιστημονικές ολυμπιάδες· Aletheia. |
Βασικά αποτελέσματα και benchmark
Λόγω του κορεσμού των κλασικών benchmark (όπως το MMLU), η αξιολόγηση της απόδοσης των μοντέλων Gemini μετατοπίστηκε σε εργασίες αφηρημένης σκέψης, επιστημονικής μοντελοποίησης και αυτόνομου προγραμματισμού. Τα αποτελέσματα παρατίθενται βάσει επίσημων δεδομένων Google (self-reported)· η σύγκρισή τους είναι ορθή μόνο όταν συμπίπτουν η λειτουργία inference, η παρουσία/απουσία tool use, η μέθοδος δειγματοληψίας (single-attempt εναντίον majority voting) και το συγκεκριμένο model-id.
| Benchmark | Περιγραφή εργασίας | Gemini 2.5 Pro (Ιούν. 2025) | Gemini 3 Pro (Νοέμβ. 2025) | Gemini 3.1 Pro (Φεβρ. 2026) | Gemini 3 Deep Think (Φεβρ. 2026) |
|---|---|---|---|---|---|
| MMLU | Πολυεργασιακή κατανόηση γλώσσας | — | — | — | — |
| GPQA Diamond | Επιστημονικές ερωτήσεις επιπέδου PhD | 84,0% | 91,9% | 94,3% | Δ/Υ |
| Humanity's Last Exam | Γνώσεις αιχμής ανά θεματικό πεδίο | 18,8% | 37,5% | 44,4% | 48,4% |
| ARC-AGI-2 | Αφηρημένα λογικά παζλ | 4,9% | 31,1% | 77,1% | 84,6% |
| SWE-bench Verified | Αυτόνομη επίλυση εργασιών σε αποθετήρια GitHub | 63,8%* | 76,2% | 80,6% | Δ/Υ |
| AIME 2025 | Μαθηματικά προβλήματα ολυμπιαδικού επιπέδου | 86,7% | — | 91,2% | — |
| Codeforces (Elo) | Βαθμολογία σε ανταγωνιστικό προγραμματισμό | — | — | 2887 | 3455 |
* Το αποτέλεσμα του 2.5 Pro στο SWE-bench ελήφθη με custom agent setup.
Θέσεις στο LMArena (στιγμιότυπο τέλους Φεβρουαρίου 2026)
Το LMArena (πρώην Chatbot Arena) — ανεξάρτητη πλατφόρμα τυφλής ζευγαρωτής ψηφοφορίας. Οι βαθμολογίες υπολογίζονται δυναμικά· οι τιμές κατά την εκκίνηση του μοντέλου ενδέχεται να διαφέρουν από τις τρέχουσες.
| Μοντέλο | Βαθμολογία | Θέση | Ψήφοι | Σημείωση |
|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 1500 ± 9 | #3 | 4 060 | Preliminary |
| Gemini 3 Pro | 1486 ± 4 | #5 | 37 854 | |
| Gemini 3 Flash | 1473 ± 5 | #7 | 28 847 | |
| Gemini 2.5 Pro | 1464 ± 3 | #9 | 97 296 | |
| Gemini 2.5 Flash | 1411 ± 3 | #64 | 96 163 |
Κατά την εκκίνηση στις 18 Νοεμβρίου 2025 το Gemini 3 Pro επέτυχε βαθμολογία 1501 Elo, γινόμενο το πρώτο μοντέλο που ξεπέρασε το όριο 1500 στο LMArena.
Εξειδικευμένα και αγεντικά συστήματα
Το οικοσύστημα Gemini επεκτείνεται με μοντέλα και πλατφόρμες ικανές να εκτελούν πολυβηματικές ενέργειες σε ψηφιακό και φυσικό περιβάλλον.
Αυτόνομοι πράκτορες
- Jules — αυτόνομος πράκτορας κωδικοποίησης, που λειτουργεί ασύγχρονα σε προστατευμένες εικονικές μηχανές cloud. Δημιουργεί κλάδους και pull requests στο GitHub. Κυκλοφόρησε σε ανοιχτή beta στο Google I/O στις 20 Μαΐου 2025 (περισσότερες από 140 000 βελτιώσεις κώδικα κατά την περίοδο beta), GA — 6 Αυγούστου 2025. Μέχρι το τέλος του 2025 έγινε ένας από τους μεγαλύτερους συνεισφέροντες στα εσωτερικά αποθετήρια της Google.
- Project Mariner — ερευνητικό πρωτότυπο πράκτορα προγράμματος περιήγησης για πολυβηματικές εργασίες στον ιστό. Μεταφέρθηκε σε εικονικές μηχανές cloud με υποστήριξη έως 10 παράλληλων εργασιών και λειτουργία «Teach & Repeat». Επέτυχε 83,5% στο benchmark WebVoyager. Οι δυνατότητες Computer Use μεταφέρθηκαν στο Gemini API.
- Google Antigravity — ολοκληρωμένο περιβάλλον ανάπτυξης (IDE) για τη διαχείριση πρακτόρων AI που παρουσιάστηκε τον Νοέμβριο του 2025. Οι πράκτορες τροποποιούν αυτόνομα κώδικα, αλληλεπιδρούν με το terminal και τον ενσωματωμένο browser, επιστρέφοντας επαληθεύσιμα αντικείμενα (diffs κώδικα) για έγκριση από τον προγραμματιστή.
- Πράκτορας Aletheia — εξειδικευμένος μαθηματικός ερευνητικός πράκτορας βάσει Gemini 3 Deep Think. Διαθέτει επαληθευτή σε φυσική γλώσσα και εργαλεία αναζήτησης στον ιστό για έλεγχο βιβλιογραφίας. Στις αρχές του 2026 επέλυσε αυτόνομα αρκετά ανοιχτά μαθηματικά προβλήματα από τη βάση του Erdős και συνυπέγραψε επιστημονικές δημοσιεύσεις.
Πράκτορες AI για καταναλωτές
- Phone Automations — ενσωμάτωση αυτόνομου πράκτορα στο επίπεδο λειτουργικού συστήματος Android (beta για Pixel 10 και Samsung Galaxy S26). Λειτουργεί σε προστατευμένο απομονωμένο περιβάλλον (secure sandbox), ικανό να πλοηγείται σε εφαρμογές τρίτων βάσει οπτικής ανάλυσης GUI.
- Gemini in Chrome (Auto Browse) — πράκτορας προγράμματος περιήγησης για αυτοματοποίηση πολυβηματικών εργασιών στον ιστό, διαθέσιμος σε όλους τους χρήστες Chrome από τον Σεπτέμβριο 2025 (ενημερώθηκε σε Gemini 3 τον Ιανουάριο 2026).
Computer Use
Τα μοντέλα Gemini 2.5 Computer Use είναι βελτιστοποιημένα για τη διαχείριση γραφικών διεπαφών χρήστη (UI). Το σύστημα δέχεται ως είσοδο στιγμιότυπα οθόνης και ιστορικό ενεργειών, δημιουργώντας συντεταγμένες για προγραμματιστική προσομοίωση δείκτη και εντολές πληκτρολογίου.
Gemini Robotics
Μοντέλα κατηγορίας Vision-Language-Action (VLA) και Embodied Reasoning (ER) που παρουσιάστηκαν τον Μάρτιο του 2025. Αυτές οι αρχιτεκτονικές επεξεργάζονται χωροχρονικές πληροφορίες και προβλέπουν 3D τροχιές κίνησης ρομποτικών βραχιόνων ως εγγενή τροπικότητα εξόδου (arXiv:2503.20020).
Εξειδικευμένα γεννητικά μοντέλα (αρχές 2026)
- Nano Banana 2 (Gemini 3.1 Flash Image) — κυκλοφόρησε 26 Φεβρουαρίου 2026, οπτικό μοντέλο που συνδυάζει την ταχύτητα της αρχιτεκτονικής Flash με την ποιότητα Pro. Εξασφαλίζει αυστηρή διατήρηση ταυτότητας χαρακτήρων (character consistency), εγγενή δημιουργία τυπογραφίας εντός εικόνων και ενσωμάτωση κρυπτογραφικών υδατογραφημάτων SynthID με μεταδεδομένα C2PA.
- Lyria 3 — μουσικό μοντέλο, ενσωματωμένο στην εφαρμογή Gemini στις 18 Φεβρουαρίου 2026. Δημιουργεί 30 δευτερόλεπτα μουσικές συνθέσεις (συμπεριλαμβανομένου φωνητικού και οργανικού) βάσει κειμενικών prompt, φωτογραφιών ή βίντεο.
- Veo 3.1 — μοντέλο δημιουργίας βίντεο. Υποστηρίζει δημιουργία κλιπ χρησιμοποιώντας έως τρεις εικόνες αναφοράς («Ingredients to Video»), δημιουργία μεταβάσεων μεταξύ καθορισμένων πρώτου και τελευταίου καρέ, εγγενή απόδοση κατακόρυφων βίντεο (9:16) και upscaling σε ανάλυση 4K.
- Med-Gemini — μοντέλο ειδικού τομέα για ιατρικές εργασίες (arXiv:2404.18416, arXiv:2405.03162).
Εφαρμογές και οικοσύστημα
Η Google ενσωματώνει βαθιά το Gemini στα προϊόντα της για καταναλωτές και προγραμματιστές.
Προϊόντα για καταναλωτές
- Εφαρμογή Gemini: Chatbot (πρώην Bard, μετονομάστηκε 8 Φεβρουαρίου 2024), που χρησιμοποιεί μοντέλα της οικογένειας Gemini ως καθολικό βοηθό AI. Έως τον Φεβρουάριο 2026 έχει περισσότερους από 750 εκατομμύρια ενεργούς χρήστες. Η τρέχουσα ανάπτυξη (rollout) περιλαμβάνει το μοντέλο 3.1 Pro. Συνδρομές: Google AI Pro ($19,99/μήνα, αντικατέστησε το Google One AI Premium) και Google AI Ultra ($249,99/μήνα, με πρόσβαση σε Deep Think, Veo 3 και προτεραιότητα σε λειτουργίες).
- Google Workspace: Ενσωμάτωση Gemini σε Gmail, Docs, Sheets, Meet για βοήθεια στη συγγραφή κειμένων, ανάλυση δεδομένων και δημιουργία περιεχομένου (ανανέωση επωνυμίας από Duet AI).
- Google Αναζήτηση: Η λειτουργία AI Overviews δημιουργεί συνοπτικές απαντήσεις σε σύνθετα ερωτήματα βάσει εξειδικευμένου μοντέλου Gemini. Η AI Mode, που ξεκίνησε στο Google I/O 2025, παρέχει εις βάθος αναζήτηση με αγεντικές δυνατότητες (κράτηση, αγορές).
- Android και Pixel: Το Gemini Nano (v3 στο Pixel 10 με chip Tensor G5, Αύγουστος 2025) λειτουργεί τοπικά σε smartphones, παρέχοντας έξυπνες απαντήσεις, σύνοψη, ανίχνευση απατηλών κλήσεων και προσβασιμότητα, διαφυλάσσοντας την ιδιωτικότητα δεδομένων. Το ML Kit GenAI API για προγραμματιστές υποστηρίζει σύνοψη, διόρθωση και αναγνώριση φωνής στη συσκευή.
- NotebookLM: Εξελίχθηκε από εργαλείο σημειώσεων σε ολοκληρωμένη δημιουργική πλατφόρμα. Ενσωματώθηκε στο Google Workspace τον Μάρτιο του 2025. Υποστηρίζει διαδραστικά Audio Overviews, Video Overviews, Mind Maps, διαφάνειες, infographics. Ενημερώθηκε σε Gemini 3 τον Δεκέμβριο 2025· πλήρες πλαίσιο 1 εκατ. token για chat — από τον Φεβρουάριο 2026.
- Gemini Live: Λειτουργίες κάμερας και κοινής χρήσης οθόνης από το Project Astra έγιναν δωρεάν για όλους τους χρήστες Android και iOS.
Πλατφόρμες για προγραμματιστές
- Google AI Studio και Gemini API: Βασικές διεπαφές για πρόσβαση στα μοντέλα Gemini μέσω API. Έως τον Φεβρουάριο 2026 υποστηρίζουν capability blocks: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
- Vertex AI: Εταιρική πλατφόρμα με εκτεταμένες δυνατότητες ασφάλειας και διαχείρισης.
- Google Gen AI SDK: Έφτασε σε GA για Python, JavaScript/TypeScript, Go και Java έως τον Μάιο 2025, παρέχοντας ενιαία πρόσβαση στο Gemini Developer API και στο Vertex AI. Υποστηρίζει Model Context Protocol (MCP).
- Gemini CLI: Εργαλείο γραμμής εντολών για κωδικοποίηση AI σε terminal (ξεκίνησε τον Ιούνιο 2025).
- Interactions API: Ενιαία διεπαφή για μοντέλα και πράκτορες (beta από Δεκέμβριο 2025).
Κύκλος ζωής API και διαχείριση εκδόσεων
Τα μοντέλα Gemini στο API κατηγοριοποιούνται σε stable, preview, latest και experimental. Το συγκεκριμένο model_id και η οικογένεια μοντέλων δεν είναι το ίδιο πράγμα· για σενάρια production είναι κρίσιμη η δέσμευση σε συγκεκριμένη έκδοση και τις ημερομηνίες υποστήριξής της. Στην τεκμηρίωση API τηρείται μητρώο καταργήσεων με αναγραφή ημερομηνιών διακοπής υποστήριξης.
Για την υποστήριξη εκτεταμένων αυτόνομων εργασιών έχουν υλοποιηθεί: Session Resumption (αποθήκευση κατάστασης συνεδρίας στον διακομιστή έως 24 ώρες) και Context Compression (μηχανισμός κυλιόμενου παραθύρου για αυτόματη συμπίεση πλαισίου κατά υπέρβαση ορίου).
Τον Δεκέμβριο 2025 η Google μείωσε τις δωρεάν ποσοστώσεις API κατά περίπου 92% (χωρίς προειδοποίηση), γεγονός που προκάλεσε έντονη αντίδραση της κοινότητας προγραμματιστών. Ταυτόχρονα, το κόστος εξυπηρέτησης των μοντέλων Gemini μειώθηκε κατά 78% το 2025 χάρη σε βελτιστοποιήσεις.
Περιορισμοί και ανοιχτά ζητήματα
- Ψευδαισθήσεις και εφευρέσεις (confabulations): Τα μοντέλα διατηρούν την τάση δημιουργίας πραγματολογικά εσφαλμένων πληροφοριών, ιδίως όταν είναι απενεργοποιημένες οι λειτουργίες εδραίωσης (Search Grounding). Το Gemini 3.1 Pro μείωσε το ποσοστό ψευδαισθήσεων στο benchmark SimpleQA σε σχέση με προηγούμενες εκδόσεις, ωστόσο το πρόβλημα παραμένει συστημικό για όλα τα LLM.
- Ασυνείδητη λογοκλοπή (Subconscious Plagiarism): Σε πειράματα με τον πράκτορα Aletheia εντοπίστηκε πρόβλημα αναπαραγωγής μη τετριμμένων αποδείξεων από το σύνολο εκπαίδευσης, που παρουσιάζονται ως αυτόνομες ανακαλύψεις, γεγονός που περιπλέκει την επικύρωση της πρωτοτυπίας ερευνών AI.
- Υποβάθμιση σε μεγάλο πλαίσιο: Κατά την επεξεργασία πλαισίων μεγέθους 1 εκατομμυρίου token τα μοντέλα υπόκεινται στο φαινόμενο «Lost in the Middle» — μείωση ακρίβειας εξαγωγής γεγονότων από τη μέση του εγγράφου.
- Υψηλό υπολογιστικό κόστος: Ο inference με μέγιστες ρυθμίσεις Deep Think απαιτεί σημαντικά περισσότερο χρόνο και πόρους (TPU), γεγονός που περιορίζει τη χρήση σε σύγχρονες εφαρμογές πραγματικού χρόνου.
- Ψευδώς θετικές αρνήσεις (Over-refusals): Λόγω αυστηρών αλγορίθμων ευθυγράμμισης (alignment), τα μοντέλα για σύνθετη συλλογιστική τείνουν να αρνούνται νόμιμα αιτήματα, ταξινομώντας τα εσφαλμένα ως δυνητικά επικίνδυνα (ειδικά στο πλαίσιο ανάλυσης κώδικα και ασφάλειας πληροφοριών). Στα model card επισημαίνονται επίσης προβλήματα «κηρυγματικού» (preachy) τόνου στις αρνήσεις.
- Περιορισμοί συλλογισμού: Τα model cards των σειρών 2.5 και 3 απαριθμούν περιορισμούς στην αιτιακή κατανόηση (causal understanding), σύνθετες λογικές παραγωγές (complex logical deduction) και αντιπραγματική συλλογιστική (counterfactual reasoning), καθώς και ατελή προβλεψιμότητα τήρησης προϋπολογισμών σκέψης.
Ηθικές πτυχές και ασφάλεια
Η ανάπτυξη των μοντέλων Gemini συνοδεύεται από ένα πολυεπίπεδο σύστημα μέτρων ασφαλείας.
Γενικό πλαίσιο
Το Secure AI Framework (SAIF) — γενική προσέγγιση της Google στην ασφάλεια συστημάτων AI (ανακοινώθηκε τον Ιούνιο 2023), που διαμορφώνει το πλαίσιο ανάπτυξης χωρίς να αποτελεί Gemini-ειδικό πρότυπο. Το Frontier Safety Framework v3 (Σεπτέμβριος 2025) καλύπτει τομείς CBRN, κυβερνοασφάλειας, ML R&D, χειραγωγικής επίδρασης και πειραματική προσέγγιση στους κινδύνους αναντιστοιχίας (misalignment).
Μέτρα ειδικά για το Gemini
- Model cards — πρωτεύουσες πηγές πληροφοριών για τους περιορισμούς και την ασφάλεια συγκεκριμένων μοντέλων. Περιέχουν ενότητες Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. Το model card του Gemini 3 Pro επιβεβαίωσε ότι το μοντέλο δεν επέτυχε κανένα κρίσιμο επίπεδο δυνατοτήτων (Critical Capability Level) στους τομείς CBRN και κυβερνοασφάλειας.
- Έλεγχος προκατάληψης και τοξικότητας: Ανάλυση και μετριασμός προκατάληψης στα δεδομένα εκπαίδευσης και στη δημιουργία περιεχομένου.
- Ομάδες κόκκινης ομάδας (Red Teaming): Προσομοίωση επιθέσεων για εντοπισμό ευπαθειών και ανεπιθύμητης συμπεριφοράς. Ανεξάρτητες δοκιμές αναντιστοιχίας ανακάλυψαν «κάποια αύξηση κατανόησης της κατάστασης», αλλά δεν εντόπισαν κρίσιμους κινδύνους.
Ανιχνευτές ασφάλειας (Safety Probes)
Για την πρόληψη δημιουργίας επιβλαβούς περιεχομένου εφαρμόζεται ταξινόμηση κρυφών ενεργοποιήσεων. Για την επίλυση του προβλήματος απώλειας σήματος σε μεγάλα πλαίσια χρησιμοποιείται η αρχιτεκτονική MultiMax: ο ανιχνευτής εξάγει τη μέγιστη τιμή από όλα τα στρώματα για κάθε token στην ακολουθία :
Οι ανιχνευτές συνδυάζονται με βασικά μοντέλα σε ιεραρχικούς ταξινομητές, αυξάνοντας την ακρίβεια φιλτραρίσματος με χαμηλό υπολογιστικό κόστος (arXiv:2601.11516).
Κρυπτογραφική σήμανση (SynthID)
Τα ηχητικά δεδομένα που δημιουργούνται μέσω Live API και οι εικόνες (από τα μοντέλα Nano Banana / Flash Image) σημαίνονται με τον αλγόριθμο SynthID. Ένα αόρατο υδατογράφημα ενσωματώνεται στο επίπεδο εικονοστοιχείων ή ηχητικού φάσματος, εξασφαλίζοντας μηχανική αναγνώριση δημιουργημένου περιεχομένου. Το μοντέλο Nano Banana 2 (Φεβρουάριος 2026) ενσωματώνει SynthID με μεταδεδομένα C2PA.
Thinking και το ζήτημα διαφάνειας
Τα μοντέλα με λειτουργία σκέψης (σειρές 2.5/3) μπορούν να επιστρέφουν thought summaries — σύντομες περιλήψεις εσωτερικών συλλογισμών και όχι ολόκληρη τη ροή ενδιάμεσων token. Αυτό παρέχει ορισμένο επίπεδο διαφάνειας, ωστόσο επικρίνεται επειδή οι πραγματικές «ακατέργαστες» αλυσίδες συλλογισμού κρύβονται πίσω από απλοποιημένες περιλήψεις.
Ρυθμιστικές πτυχές
Στο πλαίσιο του Νόμου της ΕΕ για την Τεχνητή Νοημοσύνη (EU AI Act) η Google υπέγραψε τον Κώδικα Πρακτικών της ΕΕ για την AI (δημοσιεύτηκε 10 Ιουλίου 2025) μαζί με OpenAI και Anthropic. Το Gemini ταξινομείται ως μοντέλο AI γενικού σκοπού (GPAI) με συστημικό κίνδυνο, γεγονός που συνεπάγεται πρόσθετες υποχρεώσεις ασφάλειας (σε ισχύ από 2 Αυγούστου 2025).
Ανταγωνιστικό περιβάλλον
Η περίοδος Νοεμβρίου — Δεκεμβρίου 2025 υπήρξε ο πυκνότερος ανταγωνιστικός κύκλος στην ιστορία της AI: Gemini 3 Pro (18 Νοεμβρίου), Claude Opus 4.5 της Anthropic (24 Νοεμβρίου) και GPT-5.2 της OpenAI (11 Δεκεμβρίου) κυκλοφόρησαν μέσα σε 24 ημέρες. Τον Φεβρουάριο 2026 κανένα μοντέλο δεν κυριαρχεί σε όλες τις κατηγορίες: το Gemini 3 Pro ηγείται στο LMArena για κείμενο, όραση, αναζήτηση και πολυγλωσσικότητα· το GPT-5.2 ηγείται σε καθαρά μαθηματικά (100% AIME 2025 χωρίς εργαλεία) και SWE-bench Pro· το Claude Opus 4.5 ανταγωνίζεται στο SWE-bench Verified. Όσον αφορά το κόστος API, το Gemini είναι περίπου 42% φθηνότερο από το GPT-5 για συγκρίσιμες κλήσεις.
Επιχειρηματικοί δείκτες
Σύμφωνα με τα οικονομικά αποτελέσματα της Alphabet για το Q4 2025 (δημοσιεύτηκαν 4 Φεβρουαρίου 2026): έσοδα Google Cloud — $17,7 δισ. για το τρίμηνο (+48% σε ετήσια βάση)· λειτουργικό περιθώριο — 29,9%· χαρτοφυλάκιο παραγγελιών Cloud — $240 δισ. (διπλασιασμός σε ετήσια βάση). Περισσότερες από 120 000 επιχειρήσεις χρησιμοποιούν το Gemini. Τον Ιανουάριο 2026 η Apple ανακοίνωσε σχέδια ενσωμάτωσης του Gemini στη Siri. Η Google επεξεργάζεται περισσότερα από 10 δισεκατομμύρια token ανά λεπτό μέσω API. Εσωτερικοί πράκτορες AI της Google δημιουργούν περίπου το 50% του κώδικα της εταιρείας. Οι κεφαλαιουχικές δαπάνες για το 2026 έχουν προγραμματιστεί στα $175–185 δισ. (σχεδόν διπλάσια σε σχέση με $91,45 δισ. το 2025).
Παραπομπές
- Ευρετήριο μοντέλων Google DeepMind
- Τεκμηρίωση Gemini API για προγραμματιστές
- Κατάλογος μοντέλων Gemini API
- Τεκμηρίωση Gemini Thinking
- Μητρώο καταργήσεων μοντέλων Gemini
- Ευρετήριο model cards Google DeepMind
Βιβλιογραφία
Πρωτεύουσες τεχνικές εκθέσεις Gemini
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.
Εξειδικευμένα μοντέλα και εφαρμογές
- Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
- Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
- Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
- DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.
Βιβλιογραφία (ανασκοπήσεις και μέθοδοι)
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
- Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
- Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.
Επίσημες αναρτήσεις blog Google
- Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
- Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
- Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
- Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
- Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
- Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
- Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
- The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
- The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.