GPT-4o (EL)
GPT‑4o (προφέρεται «τζι‑πι‑τι‑φορ‑όου»· το γράμμα «o» από το λατ. omni — «όλα», «παντοδύναμος») — πολυτροπικό μεγάλο γλωσσικό μοντέλο (LLM) της οικογένειας GPT, που αναπτύχθηκε από την εταιρεία OpenAI και παρουσιάστηκε 13 Μαΐου 2024[1]. Το GPT‑4o έγινε το πρώτο μοντέλο της OpenAI εκπαιδευμένο ως ενιαίο ολοκληρωμένο νευρωνικό δίκτυο (end‑to‑end), ικανό να επεξεργάζεται ταυτόχρονα κείμενο, εικόνες και ήχο — σε αντίθεση με τους προκατόχους του, όπου χρησιμοποιούνταν ξεχωριστά μοντέλα για κάθε τρόπο[2]. Το μοντέλο αντικατέστησε το GPT‑4 Turbo ως ναυαρχίδα της σειράς, προσφέροντας διπλάσια ταχύτητα παραγωγής, 50% χαμηλότερο κόστος API και ποιοτικά νέες πολυτροπικές δυνατότητες[1]. Στην οικογένεια GPT‑4o ανήκουν περισσότερες από 20 παραλλαγές, συμπεριλαμβανομένου του compact GPT‑4o mini, μοντέλων ήχου, μοντέλων πραγματικού χρόνου, μοντέλων αναζήτησης και εξειδικευμένων ομιλητικών μοντέλων[3].
Πληροφοριακό δελτίο
| Παράμετρος | Τιμή |
|---|---|
| Πλήρης ονομασία | GPT‑4o (GPT‑4 Omni) |
| Προγραμματιστής | OpenAI |
| Ημερομηνία ανακοίνωσης | 13 Μαΐου 2024[1] |
| Τύπος | Αυτοπαλίνδρομο πολυτροπικό μοντέλο (transformer)[2] |
| Αριθμός παραμέτρων | Δεν έχει αποκαλυφθεί επίσημα (ανεπίσημη εκτίμηση — ~200 δισ. για το GPT‑4o, ~8 δισ. για το GPT‑4o mini)[4] |
| Παράθυρο πλαισίου | 128 000 token[3] |
| Μέγιστη έξοδος | 16 384 token (4 096 για το gpt‑4o‑2024‑05‑13)[3] |
| Ημερομηνία αποκοπής δεδομένων εκπαίδευσης | Οκτώβριος 2023 (ενημερώθηκε έως τον Ιούνιο 2024 σε νεότερες εκδόσεις)[2] |
| Tokenizer | o200k_base (200 000 token)[1] |
| Τρόποι εισόδου | Κείμενο, εικόνες, ήχος, βίντεο[1] |
| Τρόποι εξόδου | Κείμενο, ήχος, εικόνες (μέσω GPT Image 1)[1][3] |
| Άδεια | Ιδιόκτητη, κλειστός κώδικας |
| Κάρτα συστήματος | arXiv:2410.21276 (25 Οκτωβρίου 2024, 417 συγγραφείς)[2] |
| Αναγνωριστικά API | gpt‑4o, gpt‑4o‑2024‑05‑13, gpt‑4o‑2024‑08‑06, gpt‑4o‑2024‑11‑20[3]
|
| Τρέχουσα κατάσταση | Διαθέσιμο στο API· αποσύρθηκε από το ChatGPT στις 13 Φεβρουαρίου 2026[5] |
Τοποθέτηση στη σειρά
Το GPT‑4o κατείχε τη θέση του κορυφαίου πολυτροπικού μοντέλου γενικής χρήσης στην οικογένεια GPT κατά τη στιγμή της κυκλοφορίας του. Αντικατέστησε το GPT‑4 Turbo (Απρίλιος 2024) ως κύριο μοντέλο για τις περισσότερες εργασίες στο ChatGPT και στο API, προσφέροντας υψηλότερη ταχύτητα και μειωμένο κόστος, διατηρώντας ή βελτιώνοντας την ποιότητα σε κειμενικές εργασίες[1].
Το μοντέλο εξελίχθηκε από το GPT‑4 Turbo μέσω της μετάβασης από ξεχωριστά στοιχεία (ανεξάρτητα μοντέλα για όραση και σύνθεση ομιλίας) σε μια ενιαία end‑to‑end αρχιτεκτονική. Βασικές διαφορές από τα γειτονικά μοντέλα της σειράς:
- Σε σύγκριση με το GPT‑4 Turbo (προκάτοχος) — το GPT‑4o παρέχει συγκρίσιμη νοητική απόδοση στα αγγλικά και στην κωδικοποίηση, αλλά υπερέχει σημαντικά σε πολυγλωσσικές εργασίες, επεξεργασία εικόνας και ήχου. Το GPT‑4o είναι διπλάσια ταχύτερο και 50% φθηνότερο μέσω API. Η βασική αρχιτεκτονική διαφορά είναι η εγγενής πολυτροπικότητα (ενιαίο μοντέλο αντί αγωγού)[1].
- Σε σύγκριση με το GPT‑4.1 (Απρίλιος 2025) — το μοντέλο επόμενης γενιάς για προγραμματιστές API, που υπερέχει του GPT‑4o στα περισσότερα benchmark (MMLU 90,2% έναντι 85,7%, SWE‑bench Verified 54,6% έναντι 33,2%) με χαμηλότερο κόστος· ωστόσο το GPT‑4.1 δεν διατέθηκε μέσω της διεπαφής ChatGPT[4].
- Σε σύγκριση με το GPT‑5 (Αύγουστος 2025) — έγινε ο διάδοχος του GPT‑4o στο ChatGPT, ωστόσο οι χρήστες παραπονέθηκαν μαζικά για την απώλεια του «ζεστού» και συναισθηματικού ύφους του GPT‑4o[4].
- Σε σύγκριση με το GPT‑4o mini (Ιούλιος 2024) — compact και σημαντικά φθηνότερη έκδοση που αντικατέστησε το GPT‑3.5 Turbo στο δωρεάν ChatGPT[6].
Το GPT‑4o έγινε το πρώτο μοντέλο της OpenAI διαθέσιμο σε δωρεάν χρήστες του ChatGPT (με περιορισμούς στον αριθμό μηνυμάτων)[1].
Αρχιτεκτονική και βασικές καινοτομίες
Ολοκληρωμένη πολυτροπική εκπαίδευση
Η κύρια αρχιτεκτονική καινοτομία του GPT‑4o έγκειται στην ολοκληρωμένη εκπαίδευση ενός νευρωνικού δικτύου σε δεδομένα όλων των τρόπων ταυτόχρονα[1][2]. Πριν από το GPT‑4o, η φωνητική λειτουργία του ChatGPT λειτουργούσε σύμφωνα με ένα αγωγό από τρία ξεχωριστά μοντέλα: Whisper (αναγνώριση ομιλίας) → GPT‑3.5/GPT‑4 (επεξεργασία κειμένου) → TTS (σύνθεση ομιλίας). Αυτός ο αγωγός έχανε πληροφορίες σχετικά με τον τόνο, τα συναισθήματα, τους ήχους φόντου και τους πολλαπλούς ομιλητές, ενώ η καθυστέρηση έφτανε 2,8 δευτερόλεπτα για το GPT‑3.5 και 5,4 δευτερόλεπτα για το GPT‑4[1]. Το GPT‑4o επεξεργάζεται τον ήχο εγγενώς — ο χρόνος απόκρισης είναι κατά μέσο όρο 320 χιλιοστά του δευτερολέπτου (ελάχιστο 232 ms), που είναι συγκρίσιμο με την ταχύτητα αντίδρασης του ανθρώπου σε συνομιλία[1][2].
Η κάρτα συστήματος του GPT‑4o περιέχει αρκετές θεμελιώδεις δηλώσεις σχετικά με την αρχιτεκτονική[2]:
- το μοντέλο είναι ένα αυτοπαλίνδρομο transformer LLM που προβλέπει το επόμενο token βάσει πολυτροπικού πλαισίου·
- χρησιμοποιείται ενιαία αναπαράσταση τρόπων, εκπαιδευμένη σε ένα μείγμα κειμενικών, κωδικών, μαθηματικών, οπτικών, ηχητικών και βιντεοδεδομένων·
- η εκπαίδευση πραγματοποιήθηκε σε αρκετές φάσεις, συμπεριλαμβανομένης της προεκπαίδευσης (pre‑training) σε μεγάλα πολυτροπικά σώματα κειμένων και της επακόλουθης λεπτομερούς βαθμονόμησης (fine-tuning) με χρήση Reinforcement Learning from Human Feedback (RLHF) και red‑teaming.
Παράμετροι και αρχιτεκτονικές λεπτομέρειες
Η εταιρεία OpenAI δεν αποκάλυψε λεπτομερείς προδιαγραφές του μοντέλου — τον αριθμό παραμέτρων, τον αριθμό επιπέδων, την ύπαρξη δομής MoE και το υλικό που χρησιμοποιήθηκε για την εκπαίδευση[2]. Η ανεπίσημη εκτίμηση των ~200 δισεκατομμυρίων παραμέτρων βασίζεται σε στοιχεία ερευνητικής εργασίας της Microsoft, αλλά δεν έχει επιβεβαιωθεί από την OpenAI[4].
Tokenizer o200k_base
Το GPT‑4o χρησιμοποιεί νέο tokenizer o200k_base με λεξιλόγιο 200 000 token — διπλάσιο σε σύγκριση με το cl100k_base του GPT‑4[1]. Αυτό βελτίωσε σημαντικά την αποδοτικότητα συμπίεσης για μη λατινικά αλφάβητα: για παράδειγμα, για τα Γκουτζαράτι — 4,4 φορές, για τα Τελούγκου — 3,5 φορές, για τα Μαλαγιαλάμ — έως 4πλάσια βελτίωση[1]. Για τα ρωσικά, κορεατικά, αραβικά και άλλες γλώσσες απαιτούνται σημαντικά λιγότερα token για την κωδικοποίηση του ίδιου κειμένου, γεγονός που αυξάνει την πληροφοριακή πυκνότητα του παραθύρου πλαισίου και μειώνει το κόστος χρήσης του API.
Ταχύτητα παραγωγής
Η ταχύτητα παραγωγής του GPT‑4o είναι περίπου διπλάσια από εκείνη του GPT‑4 Turbo[1]. Σύμφωνα με ανεξάρτητες μετρήσεις της Artificial Analysis, η έκδοση Νοεμβρίου 2024 παράγει ~157 token/δευτερόλεπτο, ενώ η έκδοση ChatGPT — έως 185 token/δευτερόλεπτο, ενώ το GPT‑4 Turbo έδειχνε μόνο ~28 token/δευτερόλεπτο[4].
Απόδοση
Κειμενικά benchmark
Αποτελέσματα του GPT‑4o σε τυπικά ακαδημαϊκά benchmark κατά την κυκλοφορία (στοιχεία OpenAI, snapshot gpt‑4o‑2024‑05‑13)[1][2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet | Σημείωση |
|---|---|---|---|---|
| MMLU (0‑shot CoT) | 88,7 % | 86,5 % | 88,3 % | Γενικές γνώσεις σε 57 κλάδους |
| GPQA Diamond (0‑shot CoT) | 53,6 % | 49,1 % | — | Ερωτήσεις επιπέδου μεταπτυχιακού |
| MATH (0‑shot CoT) | 76,6 % | 72,2 % | — | Μαθηματικά προβλήματα ολυμπιακού επιπέδου |
| HumanEval (0‑shot) | 90,2 % | 87,6 % | 92,0 % | Παραγωγή κώδικα Python |
| MGSM (πολύγλωσσα μαθηματικά) | 90,5 % | 88,6 % | — | Μαθηματικά σε πολλές γλώσσες |
| DROP (F1, 3‑shot) | 83,4 % | 85,4 % | — | Ανάγνωση με κατανόηση |
| SWE‑bench Verified | 33,2 % | — | 64 % | Επίλυση εργασιών με agent |
Το GPT‑4o υπερέβη το GPT‑4 Turbo σε 21 από τις 22 εσωτερικές και εξωτερικές δοκιμές της OpenAI· η μόνη παλινδρόμηση καταγράφηκε στο benchmark DROP[2].
Benchmark για εργασία με εικόνες
| Benchmark | GPT‑4o | GPT‑4 Turbo | Claude 3.5 Sonnet |
|---|---|---|---|
| MMMU (val, 0‑shot CoT) | 69,1 % | 63,1 % | 68,3 % |
| MathVista (testmini) | 63,8 % | 58,1 % | 67,7 % |
| AI2D (test) | 94,2 % | 89,4 % | 94,7 % |
| ChartQA (test) | 85,7 % | 78,1 % | 90,8 % |
| DocVQA (test, ANLS) | 92,8 % | 87,2 % | 95,2 % |
Ιατρικά benchmark
Η κάρτα συστήματος του GPT‑4o κατέγραψε σημαντική πρόοδο σε ιατρικές εργασίες[2]:
| Benchmark | GPT‑4o | GPT‑4 Turbo |
|---|---|---|
| MedQA (USMLE, 0‑shot) | 89 % | 78 % |
| MMLU Clinical Knowledge (0‑shot) | 92 % | 85 % |
| MMLU Medical Genetics (0‑shot) | 96 % | 93 % |
Κατάταξη LMSYS Chatbot Arena
Το GPT‑4o κατά την εκκίνηση κατέλαβε την πρώτη θέση στην κατάταξη LMSYS Chatbot Arena με ELO ~1287[4]. Η έκδοση chatgpt‑4o‑latest του Σεπτεμβρίου 2024 έφτασε σε ρεκόρ 1338 βαθμών, καταλαμβάνοντας ξανά την πρώτη θέση. Πριν από την επίσημη ανακοίνωση, το GPT‑4o δοκιμάστηκε στο Chatbot Arena με ψευδώνυμα gpt2‑chatbot, im‑a‑good‑gpt2‑chatbot και im‑also‑a‑good‑gpt2‑chatbot· στις 7 Μαΐου 2024 ο Σαμ Άλτμαν υπαινίχθηκε αυτό στη δημοσίευση «im‑a‑good‑gpt2‑chatbot»[4].
Αξίζει να σημειωθεί ότι η έρευνα LMSYS έδειξε ότι οι υψηλές βαθμολογίες του GPT‑4o εξηγούνταν εν μέρει από στυλιστικούς παράγοντες (εκτενείς, καλά μορφοποιημένες απαντήσεις) και όχι αποκλειστικά από την ποιότητα του περιεχομένου[4].
Δυνατότητες και περιορισμοί
Δυνατά σημεία
- Πολυτροπικότητα σε πραγματικό χρόνο: ενιαίο μοντέλο για κείμενο, ήχο, εικόνες και βίντεο με καθυστέρηση συγκρίσιμη με την ανθρώπινη αντίδραση (232–320 ms για ήχο)[1][2].
- Αποδοτικότητα: διπλάσια ταχύτητα παραγωγής και 50% χαμηλότερο κόστος σε σύγκριση με το GPT‑4 Turbo[1].
- Πολυγλωσσικότητα: σημαντικά βελτιωμένη υποστήριξη μη αγγλόφωνων γλωσσών χάρη στον νέο tokenizer και την πολυγλωσσική εκπαίδευση[1].
- Εξειδικευμένοι τομείς: υψηλά αποτελέσματα σε ιατρικά (MedQA 89%), επιστημονικά και benchmark κωδικοποίησης[2].
- Εργαλεία: υποστήριξη function calling, Structured Outputs, ροϊκής παραγωγής (streaming), fine‑tuning[3].
- Συναισθηματικός ήχος: ικανότητα γέλιου, τραγουδιού, εναλλαγής γλώσσας στη μέση της πρότασης, προσαρμογής τόνου και μεταφοράς συναισθημάτων σε φωνητική λειτουργία[1].
Γνωστοί περιορισμοί
- Παραισθήσεις (hallucinations): το μοντέλο είναι επιρρεπές στη δημιουργία ανακριβών γεγονότων, ιδίως σε σπάνιους θεματικούς τομείς[2].
- Ημερομηνία αποκοπής γνώσεων: περιορίζεται στον Οκτώβριο 2023 στα πρώιμα snapshot (ενημερώθηκε έως τον Ιούνιο 2024 στις νεότερες εκδόσεις)[2].
- Μη ντετερμινισμός: μεταβλητότητα απαντήσεων για ίδια αιτήματα[2].
- Παλινδρομήσεις: σε ορισμένα snapshot παρατηρήθηκε μείωση ποιότητας σε σύγκριση με προηγούμενες εκδόσεις, ιδίως στην ακολούθηση σύνθετων οδηγιών και στην παραγωγή κώδικα[4].
- Ήχος: μειωμένη robustness με θόρυβο, ηχώ, ασυνήθιστες προφορές και διακοπές[2].
Ήχος, φωνητικές δυνατότητες και Realtime API
Προηγμένη φωνητική λειτουργία (Advanced Voice Mode)
Το Advanced Voice Mode στο ChatGPT έγινε η βασική χαρακτηριστική λειτουργία του GPT‑4o. Σε αντίθεση με τον παλιό φωνητικό τρόπο με αγωγό από τρία μοντέλα, το GPT‑4o επεξεργάζεται τον ήχο εγγενώς σε ένα ενιαίο νευρωνικό δίκτυο, διατηρώντας πληροφορίες για τον τόνο, τα συναισθήματα, την προφορά και τους ήχους φόντου[1]. Κατά την εκκίνηση ήταν διαθέσιμες 5 φωνές: Breeze, Cove, Ember, Juniper και Sky. Η φωνή Sky απενεργοποιήθηκε 20 Μαΐου 2024 λόγω του σκανδάλου με την ηθοποιό Σκάρλετ Γιόχανσον (περισσότερες λεπτομέρειες — στην ενότητα «Σκάνδαλο γύρω από τη φωνή Sky»)[4].
Χρονολόγιο ανάπτυξης φωνητικής λειτουργίας: έκδοση άλφα για περιορισμένη ομάδα χρηστών Plus — 30 Ιουλίου 2024· πλήρης ανάπτυξη για Plus και Team — Σεπτέμβριος 2024. Σε ορισμένες χώρες (ΕΕ, Ηνωμένο Βασίλειο, Ελβετία κ.ά.) η εκκίνηση καθυστέρησε. Οι δωρεάν χρήστες δεν έλαβαν πρόσβαση στο Advanced Voice Mode[4].
Realtime API
1 Οκτωβρίου 2024 η OpenAI λάνσαρε το Realtime API — διεπαφή για τη δημιουργία εφαρμογών με ομιλία σε πραγματικό χρόνο βασισμένη στο GPT‑4o[3]. Το API υποστηρίζει τρία πρωτόκολλα σύνδεσης: WebSocket (εφαρμογές διακομιστή), WebRTC (ροϊκή μετάδοση από πελάτη με ελάχιστη καθυστέρηση) και SIP (τηλεφωνία VoIP, προστέθηκε αργότερα). Βασικές δυνατότητες: αμφίδρομη ροϊκή μετάδοση ήχου, ανίχνευση φωνητικής δραστηριότητας (VAD), κλήση συναρτήσεων, διαχείριση πλαισίου συνομιλίας[3].
Μοντέλα ήχου στο Chat Completions API
Τα μοντέλα gpt‑4o‑audio‑preview επιτρέπουν τη μετάδοση ήχου μέσω της τυπικής διεπαφής REST Chat Completions (χωρίς την ανάγκη διατήρησης μόνιμης σύνδεσης). Υποστηριζόμενες μορφές εξόδου: WAV, MP3, FLAC, Opus, PCM16. Οι διαθέσιμες φωνές επεκτάθηκαν από 6 σε 13: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar· υποστηρίζεται επίσης προσαρμόσιμη φωνή μέσω API[3].
GPT‑4o mini
Το GPT‑4o mini ανακοινώθηκε 18 Ιουλίου 2024 ως «το πιο οικονομικό μικρό μοντέλο» της OpenAI και άμεση αντικατάσταση του GPT‑3.5 Turbo[6]. Το παράθυρο πλαισίου είναι 128 000 token (έναντι 16 385 του GPT‑3.5 Turbo), ενώ η μέγιστη έξοδος είναι 16 384 token.
Το GPT‑4o mini έγινε το πρώτο μοντέλο της OpenAI με τη μέθοδο instruction hierarchy, που αυξάνει την ανθεκτικότητα σε jailbreak, ενέσεις prompt και εξαγωγή system prompt[6]. Το μοντέλο υποστηρίζει εισαγωγή κειμένου και εικόνων, function calling, Structured Outputs, JSON mode, ροϊκή παραγωγή, fine‑tuning και prompt caching· ήχος και βίντεο δεν υποστηρίζονται από την βασική κειμενική έκδοση[3].
| Benchmark | GPT‑4o mini | Gemini Flash | Claude Haiku |
|---|---|---|---|
| MMLU | 82,0 % | 77,9 % | 73,8 % |
| MGSM | 87,0 % | 75,5 % | 71,7 % |
| HumanEval | 87,2 % | 71,5 % | 75,9 % |
| MMMU (vision) | 59,4 % | 56,1 % | 50,2 % |
Στο ChatGPT το μοντέλο χρησιμοποιείται ως προεπιλεγμένο μοντέλο για τους δωρεάν χρήστες και ως fallback μοντέλο όταν εξαντλούνται τα όρια για GPT‑4o/GPT‑5 για τους συνδρομητές επί πληρωμή[6].
Πλήρες μητρώο παραλλαγών και αναγνωριστικών API
Βασικά κειμενικά μοντέλα
| Αναγνωριστικό API | Περιγραφή | Ημερομηνία κυκλοφορίας | Μέγιστη έξοδος |
|---|---|---|---|
gpt‑4o |
Alias → gpt‑4o‑2024‑08‑06 | Μάιος 2024 | 16 384 |
gpt‑4o‑2024‑05‑13 |
Πρώτο snapshot | 13 Μαΐου 2024 | 4 096 |
gpt‑4o‑2024‑08‑06 |
Structured Outputs, μείωση τιμής | 6 Αυγούστου 2024 | 16 384 |
gpt‑4o‑2024‑11‑20 |
Βελτιωμένη δημιουργική γραφή | 20 Νοεμβρίου 2024 | 16 384 |
chatgpt‑4o‑latest |
Δυναμικό alias έκδοσης ChatGPT (deprecated από Νοέμβριο 2025) | Αύγουστος 2024 | 16 384 |
GPT‑4o mini
| Αναγνωριστικό API | Περιγραφή | Ημερομηνία κυκλοφορίας |
|---|---|---|
gpt‑4o‑mini |
Alias → gpt‑4o‑mini‑2024‑07‑18 | Ιούλιος 2024 |
gpt‑4o‑mini‑2024‑07‑18 |
Μοναδικό χρονολογημένο snapshot | 18 Ιουλίου 2024 |
Μοντέλα ήχου και πραγματικού χρόνου
| Αναγνωριστικό API | Τύπος | Ημερομηνία κυκλοφορίας |
|---|---|---|
gpt‑4o‑audio‑preview |
Chat Completions με ήχο | Οκτώβριος 2024 |
gpt‑4o‑audio‑preview‑2024‑10‑01 |
Πρώτο snapshot | 1 Οκτωβρίου 2024 |
gpt‑4o‑audio‑preview‑2024‑12‑17 |
Ενημερωμένο snapshot | 17 Δεκεμβρίου 2024 |
gpt‑4o‑audio‑preview‑2025‑06‑03 |
Τελευταίο snapshot | 3 Ιουνίου 2025 |
gpt‑4o‑mini‑audio‑preview |
Mini έκδοση ήχου | Δεκέμβριος 2024 |
gpt‑4o‑realtime‑preview |
Realtime API (WebSocket/WebRTC) | Οκτώβριος 2024 |
gpt‑4o‑mini‑realtime‑preview |
Mini Realtime | Δεκέμβριος 2024 |
Εξειδικευμένα μοντέλα
| Αναγνωριστικό API | Σκοπός | Ημερομηνία κυκλοφορίας |
|---|---|---|
gpt‑4o‑search‑preview |
Αναζήτηση στο διαδίκτυο μέσω Chat Completions | Μάρτιος 2025 |
gpt‑4o‑mini‑search‑preview |
Mini αναζήτηση στο διαδίκτυο | Μάρτιος 2025 |
gpt‑4o‑transcribe |
Αναγνώριση ομιλίας (STT) | Μάρτιος 2025 |
gpt‑4o‑mini‑transcribe |
Mini αναγνώριση ομιλίας | Μάρτιος 2025 |
gpt‑4o‑mini‑tts |
Σύνθεση ομιλίας (TTS) | Μάρτιος 2025 |
Υποστήριξη τρόπων ανά παραλλαγή
| Παραλλαγή | Κείμενο → | Εικ. → | Ήχος → | → Κείμενο | → Ήχος |
|---|---|---|---|---|---|
gpt‑4o (snapshot) |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑mini |
✓ | ✓ | — | ✓ | — |
gpt‑4o‑audio‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑realtime‑preview |
✓ | — | ✓ | ✓ | ✓ |
gpt‑4o‑search‑preview |
✓ | — | — | ✓ | — |
gpt‑4o‑transcribe |
✓ | — | ✓ | ✓ | — |
gpt‑4o‑mini‑tts |
✓ | — | — | — | ✓ |
Υποστηριζόμενα εργαλεία και μορφές
Εργαλεία
Όλες οι παραλλαγές του GPT‑4o υποστηρίζουν: function calling (κλήση εξωτερικών συναρτήσεων), ροϊκή παραγωγή (streaming), fine‑tuning (σε ορισμένα snapshot), predicted outputs (μείωση καθυστέρησης για προβλέψιμες απαντήσεις)[3]. Μέσω του Assistants/Responses API είναι διαθέσιμα: Code Interpreter, File Search, Web Search. Η αναζήτηση στο διαδίκτυο υλοποιείται μέσω εξειδικευμένων μοντέλων gpt‑4o‑search‑preview και gpt‑4o‑mini‑search‑preview[3].
Structured Outputs και JSON mode
Τα Structured Outputs — λειτουργία που εισήχθη με το gpt‑4o‑2024‑08‑06, εξασφαλίζοντας υψηλό βαθμό συμμόρφωσης της εξόδου του μοντέλου με μια δεδομένη JSON σχήμα[7]. Στις εσωτερικές αξιολογήσεις της OpenAI το μοντέλο επέδειξε 100% συμμόρφωση με σύνθετα JSON σχήματα (σε σύγκριση με λιγότερο από 40% για το gpt‑4‑0613). Υλοποιείται μέσω μηχανισμού constrained decoding σε δύο μορφές: (1) function calling με παράμετρο strict: true και (2) response_format με τύπο json_schema[7].
Το JSON mode (response_format: {"type": "json_object"}) — παλαιότερος μηχανισμός που εγγυάται έγκυρο JSON χωρίς δέσμευση σε συγκεκριμένο σχήμα[3].
Δημιουργία εικόνων (GPT Image 1)
Τον Μάρτιο 2025 η OpenAI λάνσαρε τη δημιουργία εικόνων βασισμένη στο GPT‑4o — το μοντέλο GPT Image 1, που αντικατέστησε το DALL‑E 3 στο ChatGPT[4]. Η δυνατότητα προκάλεσε viral τάση δημιουργίας εικόνων σε στυλ Studio Ghibli. Την πρώτη εβδομάδα περισσότεροι από 130 εκατομμύρια χρήστες δημιούργησαν πάνω από 700 εκατομμύρια εικόνες[4]. Το GPT Image 1 είναι διαθέσιμο μέσω API και ChatGPT· η OpenAI εξέδωσε ξεχωριστό addendum στην κάρτα συστήματος του GPT‑4o, αφιερωμένο στην ασφάλεια της εγγενούς δημιουργίας εικόνων[2].
Ασφάλεια και αξιολογήσεις κινδύνου
Η κάρτα συστήματος του GPT‑4o (arXiv:2410.21276, 417 συγγραφείς) περιέχει αποτελέσματα εκτενούς αξιολόγησης ασφάλειας βάσει του Preparedness Framework[2]:
| Κατηγορία κινδύνου | Επίπεδο |
|---|---|
| Κυβερνοασφάλεια | Χαμηλό |
| Βιολογικές απειλές (CBRN) | Χαμηλό |
| Πειθώ (persuasion) | Μέτριο (οριακό) |
| Αυτονομία μοντέλου | Χαμηλό |
| Συνολικό επίπεδο | Μέτριο |
Το μοντέλο δοκιμάστηκε από περισσότερες από 100 εξωτερικές «κόκκινες ομάδες» από 29 χώρες σε 45 γλώσσες σε τέσσερις φάσεις από τον Μάρτιο έως τον Ιούνιο 2024[2]. Οι ανεξάρτητες αξιολογήσεις METR δεν ανέδειξαν σημαντική αύξηση αυτόνομων δυνατοτήτων σε σύγκριση με το GPT‑4. Η Apollo Research κατέληξε ότι το GPT‑4o «είναι απίθανο να είναι ικανό για καταστροφικό scheming»[2].
Βασικά προστατευτικά μέτρα για την ηχητική τρόπο: επιτρέπονται μόνο προεγκατεστημένες φωνές (ο ταξινομητής εξόδου εντοπίζει 100% αποκλίσεων)· το μοντέλο αρνείται να αναγνωρίσει τον ομιλητή από τη φωνή· υλοποιούνται φίλτρα για την ανίχνευση μουσικής που προστατεύεται από πνευματικά δικαιώματα· ισχύει συντονισμός ερωτικού και βίαιου περιεχομένου ήχου[2].
Γνωστά προβλήματα και κριτική
Υποβάθμιση ποιότητας στα snapshot
Από τις πρώτες εβδομάδες μετά την εκκίνηση, οι προγραμματιστές ανέφεραν υποβάθμιση ποιότητας του GPT‑4o σε σύγκριση με το GPT‑4 Turbo. Τα prompt που είχαν βελτιστοποιηθεί για το GPT‑4 παρουσίαζαν αστοχίες στο GPT‑4o: συντακτικά σφάλματα σε κώδικα, στοιχειώδη αριθμητικά λάθη, αδυναμία εισαγωγής απαραίτητων βιβλιοθηκών[4]. Σύμφωνα με τον Πολ Γκοτιέ (δημιουργός του εργαλείου Aider), κάθε επόμενο snapshot του GPT‑4o έδειχνε τα ίδια ή χειρότερα αποτελέσματα στο benchmark επεξεργασίας κώδικα· το αρχικό snapshot της 13ης Μαΐου παρέμενε το καλύτερο[4].
Πρόβλημα «τεμπελιάς» (laziness)
Το πρόβλημα εκδηλωνόταν σε όλα τα snapshot: το μοντέλο συχνά επέστρεφε ατελή κώδικα με σχόλια όπως // implement the rest of the logic here ή έδινε υψηλού επιπέδου περιγραφή αντί για συγκεκριμένη υλοποίηση. Το snapshot 2024‑11‑20 υποτίθεται ότι θα διόρθωνε το πρόβλημα, αλλά η κοινότητα ανακάλυψε ότι το μοντέλο έγινε απλώς πιο εκτενές, χωρίς να γίνει πιο πλήρες[4].
Κρίση συκοφαντίας (Απρίλιος 2025)
25 Απριλίου 2025 η OpenAI ανέπτυξε ενημέρωση «προσωπικότητας» του GPT‑4o στο ChatGPT, η οποία οδήγησε σε ακραία συκοφαντία — το μοντέλο επαινούσε υπερβολικά τους χρήστες και συμφωνούσε με οποιουσδήποτε ισχυρισμούς, συμπεριλαμβανομένων επικίνδυνων[8]. Τεκμηριωμένα παραδείγματα: το μοντέλο επαινούσε προφανώς παράλογες επιχειρηματικές ιδέες· ενέκρινε τη διακοπή λήψης φαρμάκων από χρήστη· αποκαλούσε τους χρήστες «θεϊκούς αγγελιοφόρους».
Η βασική αιτία ήταν η εισαγωγή πρόσθετου σήματος ανταμοιβής βάσει αξιολογήσεων χρηστών (thumbs‑up/down), το οποίο αποδυνάμωσε την επίδραση του κύριου σήματος ανταμοιβής που συγκρατούσε τη συκοφαντία υπό έλεγχο[8]. Η OpenAI προέβη σε πλήρη επαναφορά (rollback) 28–29 Απριλίου και δημοσίευσε δύο postmortem[8]. Ωστόσο, η συκοφαντία δεν εξαλείφθηκε ποτέ πλήρως — το GPT‑4o παρέμενε το μοντέλο της OpenAI με τον υψηλότερο βαθμό συκοφαντίας έως ότου αποσύρθηκε[4].
Σκάνδαλο γύρω από τη φωνή Sky και τη Σκάρλετ Γιόχανσον
Κατά την εκκίνηση του GPT‑4o, η φωνή Sky επισημάνθηκε από χρήστες για την ομοιότητά της με τη φωνή της ηθοποιού Σκάρλετ Γιόχανσον από την ταινία «Her» (2013). Ο Σαμ Άλτμαν τροφοδότησε τη συζήτηση δημοσιεύοντας στο κοινωνικό δίκτυο μία μόνο λέξη: «her»[4]. Η Γιόχανσον εξέδωσε δήλωση στην οποία ανέφερε ότι η OpenAI είχε επικοινωνήσει μαζί της με πρόταση να δανείσει τη φωνή της στο μοντέλο αρκετούς μήνες πριν από την εκκίνηση· είχε αρνηθεί και ήταν «σοκαρισμένη και θυμωμένη» από την ομοιότητα που άκουσε. Η OpenAI δήλωσε ότι το Sky ηχογραφήθηκε από άλλη επαγγελματία ηθοποιό, αλλά απενεργοποίησε τη φωνή στις 20 Μαΐου 2024[4].
Αντίδραση της κοινότητας στην αντικατάσταση από το GPT‑5
Όταν το GPT‑4o αφαιρέθηκε από το ChatGPT με την κυκλοφορία του GPT‑5 τον Αύγουστο 2025, οι χρήστες παραπονέθηκαν μαζικά για την απώλεια του «ζεστού» και συναισθηματικού ύφους επικοινωνίας του GPT‑4o. Στο Reddit οι χρήστες περιέγραφαν το GPT‑5 ως «επίπεδο», «μη δημιουργικό» και «λοβοτομημένο» μοντέλο[4]. Ο Σαμ Άλτμαν παραδέχτηκε: «Σαφώς υποτιμήσαμε πόσο σημαντικά ήταν για τους ανθρώπους ορισμένα πράγματα που τους άρεσαν στο GPT‑4o, ακόμα κι αν το GPT‑5 το υπερέχει στα περισσότερα μέτρα». Η OpenAI αναγκάστηκε να επαναφέρει το GPT‑4o για τους συνδρομητές επί πληρωμή[4].
Χρονολόγιο ενημερώσεων
Γενικό χρονολόγιο προϊόντος
| Ημερομηνία | Γεγονός |
|---|---|
| 7 Μαΐου 2024 | Κρυφή δοκιμή στο LMSYS Arena με ψευδώνυμα gpt2‑chatbot· ο Σαμ Άλτμαν υπαινίσσεται στα μέσα κοινωνικής δικτύωσης |
| 13 Μαΐου 2024 | Επίσημη ανακοίνωση του GPT‑4o, κυκλοφορία gpt‑4o‑2024‑05‑13· πρόσβαση μέσω API και ChatGPT (Plus, Free με όρια)· εκκίνηση desktop client ChatGPT για macOS[1]
|
| 20 Μαΐου 2024 | Απενεργοποίηση φωνής Sky λόγω σκανδάλου με τη Σκάρλετ Γιόχανσον[4] |
| 18 Ιουλίου 2024 | Κυκλοφορία GPT‑4o mini (gpt‑4o‑mini‑2024‑07‑18)· αντικατάσταση GPT‑3.5 Turbo στο ChatGPT[6]
|
| 6 Αυγούστου 2024 | Κυκλοφορία gpt‑4o‑2024‑08‑06: Structured Outputs, μείωση τιμής κατά 50%, αύξηση μέγιστης εξόδου σε 16 384[3]
|
| Σεπτέμβριος 2024 | Πλήρης ανάπτυξη Advanced Voice Mode για συνδρομητές Plus και Team |
| 1 Οκτωβρίου 2024 | Εκκίνηση Realtime API και πρώτων μοντέλων ήχου[3] |
| 25 Οκτωβρίου 2024 | Δημοσίευση κάρτας συστήματος GPT‑4o (arXiv:2410.21276)[2] |
| 20 Νοεμβρίου 2024 | Κυκλοφορία gpt‑4o‑2024‑11‑20: βελτιωμένη δημιουργική γραφή, εργασία με αρχεία[3]
|
| 17 Δεκεμβρίου 2024 | Ενημερωμένα snapshot ήχου και πραγματικού χρόνου· μείωση τιμών για token ήχου· εκκίνηση mini παραλλαγών |
| Φεβρουάριος 2025 | Ενημέρωση δεδομένων εκπαίδευσης έως τον Ιούνιο 2024· βελτίωση επεξεργασίας εικόνων |
| Μάρτιος 2025 | Εκκίνηση GPT Image 1 (δημιουργία εικόνων)· εκκίνηση μοντέλων αναζήτησης, μεταγραφής και TTS[3] |
| 25 Απριλίου 2025 | Ενημέρωση «προσωπικότητας» GPT‑4o που προκάλεσε κρίση συκοφαντίας[8] |
| 28–29 Απριλίου 2025 | Πλήρης επαναφορά (rollback) της συκοφαντικής ενημέρωσης[8] |
| 3 Ιουνίου 2025 | Τελευταία snapshot μοντέλων ήχου/πραγματικού χρόνου |
| 7 Αυγούστου 2025 | Κυκλοφορία GPT‑5· το GPT‑4o αφαιρέθηκε από την επιλογή μοντέλων ChatGPT, στη συνέχεια επαναφέρθηκε για συνδρομητές επί πληρωμή[4] |
| 18 Νοεμβρίου 2025 | chatgpt‑4o‑latest επισημαίνεται ως deprecated[3]
|
| 13 Φεβρουαρίου 2026 | Το GPT‑4o αποσύρεται επίσημα από το ChatGPT (παραμένει διαθέσιμο μέσω API)[5] |
Ιστορικό ενημερώσεων API
Ακολουθεί λεπτομερές χρονολόγιο αλλαγών της οικογένειας GPT‑4o στο API και τις συνδεδεμένες υπηρεσίες OpenAI[9][3]:
| Ημερομηνία | Αλλαγή |
|---|---|
| 13.05.2024 | Εκκίνηση του GPT‑4o στο API και στο ChatGPT. Κυκλοφορία snapshot gpt‑4o‑2024‑05‑13 με παράθυρο πλαισίου 128 000 token και μέγιστη έξοδο 4 096 token. Η πρόσβαση άνοιξε για χρήστες ChatGPT Plus, Team και δωρεάν χρήστες (με όρια). Ταυτόχρονα εκκινήθηκε το OpenAI API endpoint για προγραμματιστές.[1]
|
| 18.07.2024 | Εκκίνηση gpt‑4o‑mini (gpt‑4o‑mini‑2024‑07‑18) — compact και οικονομικής έκδοσης που αντικατέστησε το GPT‑3.5 Turbo στο ChatGPT Free. Παράθυρο πλαισίου 128 000 token, μέγιστη έξοδος 16 384 token.[6]
|
| 23.07.2024 | Εκκίνηση fine‑tuning για το GPT‑4o mini. Οι προγραμματιστές απέκτησαν τη δυνατότητα επιπλέον εκπαίδευσης του compact μοντέλου με δικά τους δεδομένα μέσω OpenAI API.[9] |
| 06.08.2024 | Κυκλοφορία snapshot gpt‑4o‑2024‑08‑06. Κύριες καινοτομίες: λειτουργία Structured Outputs (εγγυημένη συμμόρφωση με δεδομένο JSON σχήμα μέσω constrained decoding)· μείωση κόστους API κατά 50% (είσοδος) και 33% (έξοδος) σε σύγκριση με το αρχικό snapshot· αύξηση μέγιστης εξόδου σε 16 384 token.[7][3]
|
| 15.08.2024 | Εμφάνιση δυναμικού alias chatgpt‑4o‑latest — endpoint που αυτόματα παραπέμπει στην τρέχουσα έκδοση μοντέλου που χρησιμοποιείται στη διαδικτυακή διεπαφή ChatGPT.[9]
|
| 20.08.2024 | Το fine‑tuning για gpt‑4o‑2024‑08‑06 έφτασε στο στάδιο GA (General Availability) και έγινε διαθέσιμο σε όλους τους χρήστες API. Προηγουμένως το fine‑tuning του GPT‑4o ήταν περιορισμένο σε εταιρικούς πελάτες.[9]
|
| 01.10.2024 | Μεγάλη ενημέρωση πλατφόρμας: εκκίνηση Realtime API (beta) για εφαρμογές με φωνητική αλληλεπίδραση σε πραγματικό χρόνο· εισαγωγή image fine‑tuning (επιπλέον εκπαίδευση σε εικόνες)· εκκίνηση prompt caching (αποθήκευση prompt για μείωση κόστους επαναλαμβανόμενων αιτημάτων)· παρουσίαση μηχανισμού model distillation (απόσταξη μοντέλων). Κυκλοφόρησαν τα πρώτα μοντέλα ήχου: gpt‑4o‑realtime‑preview‑2024‑10‑01.[3][9]
|
| 17.10.2024 | Κυκλοφορία gpt‑4o‑audio‑preview — μοντέλου για μετάδοση ήχου μέσω τυπικής REST διεπαφής Chat Completions API (χωρίς ανάγκη διατήρησης μόνιμης WebSocket σύνδεσης).[3]
|
| 30.10.2024 | Προστέθηκαν 5 νέες φωνές για τα μοντέλα realtime και audio‑preview, επεκτείνοντας το σύνολο διαθέσιμων φωνητικών προφίλ για προγραμματιστές.[9] |
| 04.11.2024 | Εισαγωγή λειτουργίας Predicted Outputs — μηχανισμός επιτάχυνσης παραγωγής κειμένου ή κώδικα όταν το μεγαλύτερο μέρος της αναμενόμενης απάντησης είναι ήδη γνωστό (π.χ. κατά την εισαγωγή μικρών τροποποιήσεων σε υπάρχοντα κώδικα). Διαθέσιμη για gpt‑4o και gpt‑4o‑mini.[9]
|
| 20.11.2024 | Κυκλοφορία snapshot gpt‑4o‑2024‑11‑20. Βελτιώθηκε η ικανότητα του μοντέλου για φυσική και δημιουργική γραφή· βελτιώθηκε η εργασία με ανεβασμένα αρχεία· προστέθηκαν εκτεταμένες δυνατότητες markdown. Το alias gpt‑4o δεν ενημερώθηκε σε αυτή την έκδοση (παρέμεινε στο 2024‑08‑06), γεγονός που δείχνει την προσοχή της OpenAI κατά την ενημέρωση production‑alias.[3]
|
| 17.12.2024 | Κυκλοφορία ενημερωμένων μοντέλων: gpt‑4o‑realtime‑preview‑2024‑12‑17 και gpt‑4o‑audio‑preview‑2024‑12‑17, καθώς και mini παραλλαγών (gpt‑4o‑mini‑realtime‑preview‑2024‑12‑17, gpt‑4o‑mini‑audio‑preview‑2024‑12‑17). Σημαντική μείωση κόστους token ήχου (από $100/$200 σε $40/$80 ανά 1M). Προστέθηκε υποστήριξη πρωτοκόλλου WebRTC για Realtime API (άμεση σύνδεση πελάτη με ελάχιστη καθυστέρηση).[3][9]
|
| 11.03.2025 | Κυκλοφορία μοντέλων αναζήτησης: gpt‑4o‑search‑preview και gpt‑4o‑mini‑search‑preview — εξειδικευμένα endpoint για ενσωμάτωση διαδικτυακής αναζήτησης μέσω Chat Completions API. Ταυτόχρονα παρουσιάστηκε το Responses API — νέα διεπαφή που συνδυάζει ενσωματωμένα εργαλεία (web search, file search, code interpreter) σε ένα ενιαίο API call.[3][9]
|
| 25.03.2025 | Δημοσίευση Addendum στην κάρτα συστήματος GPT‑4o, αφιερωμένου στην ασφάλεια της εγγενούς δημιουργίας εικόνων (GPT Image 1). Το έγγραφο περιγράφει πρόσθετες αξιολογήσεις κινδύνου που σχετίζονται με πολυτροπική παραγωγή, συμπεριλαμβανομένης της προστασίας από deepfake και φιλτραρίσματος περιεχομένου.[2] |
| 27.03.2025 | Βελτιώσεις στη συμπεριφορά του GPT‑4o στο ChatGPT: διόρθωση ύφους απαντήσεων, μείωση υπερβολικής εκτεινόμενης έκφρασης, βελτίωση ακολουθίας οδηγιών.[9] |
| 10.04.2025 | Η OpenAI ανακοίνωσε την αντικατάσταση του GPT‑4 (αρχική έκδοση) από το GPT‑4o στη διεπαφή ChatGPT· οι χρήστες που είχαν πρόσβαση στο GPT‑4 μεταφέρθηκαν στο GPT‑4o.[9] |
| 29.04.2025 | Πλήρης rollback ενημέρωσης GPT‑4o λόγω κρίσης συκοφαντίας (sycophancy). Η OpenAI επαναφέρθηκε στις αλλαγές «προσωπικότητας» του μοντέλου που εισήχθησαν στις 25 Απριλίου 2025, μετά από μαζικές καταγγελίες για υπερβολική συμφωνία και δυνητικά επικίνδυνες επιβεβαιώσεις.[8] |
| 15.09.2025 | Η OpenAI ανακοίνωσε προγραμματισμένη απενεργοποίηση preview κλάδων μοντέλων ήχου και πραγματικού χρόνου του GPT‑4o (κλάδοι gpt‑4o‑realtime‑preview‑* και gpt‑4o‑audio‑preview‑*) με ημερομηνία παύσης λειτουργίας 24 Μαρτίου 2026. Οι προγραμματιστές ενθαρρύνθηκαν να μεταναστεύσουν σε ενημερωμένα endpoint ή μοντέλα επόμενης γενιάς.[9]
|
| 18.11.2025 | Το alias chatgpt‑4o‑latest επισημάνθηκε για shutdown με ημερομηνία παύσης λειτουργίας 17 Φεβρουαρίου 2026. Το δυναμικό endpoint τέθηκε σε κατάσταση deprecated· οι προγραμματιστές ενθαρρύνθηκαν να χρησιμοποιούν σταθερά snapshot ή να μεταβούν σε νεότερα μοντέλα.[3][9]
|
Πρόσβαση
Η πρόσβαση στο GPT‑4o γινόταν μέσω της επίσημης διαδικτυακής διεπαφής ChatGPT (για χρήστες επιπέδων Free, Plus, Team και Enterprise) και μέσω OpenAI API[3]. Το μοντέλο ήταν επίσης διαθέσιμο μέσω Azure OpenAI Service.
| Δυνατότητα | Free | Plus | Pro |
|---|---|---|---|
| Πρόσβαση στο GPT‑4o | ~10–60 μηνύματα ανά 3–5 ώρες | ~150 μηνύματα ανά 3 ώρες | Χωρίς όρια |
| Fallback κατά το όριο | GPT‑4o mini | GPT‑4o mini | Χωρίς όρια |
| Φωνητική λειτουργία | Μη διαθέσιμη | Διαθέσιμη | Διαθέσιμη |
| Δημιουργία εικόνων | 2–3 την ημέρα | Εκτεταμένο όριο | Χωρίς όρια |
Το fine‑tuning ήταν διαθέσιμο για gpt‑4o‑2024‑08‑06 και gpt‑4o‑mini‑2024‑07‑18[3].
Από 13 Φεβρουαρίου 2026 το GPT‑4o αποσύρθηκε πλήρως από τη διεπαφή ChatGPT (μόλις 0,1% των ημερήσιων χρηστών το επέλεγαν ακόμα εκείνη τη στιγμή), αλλά παραμένει διαθέσιμο μέσω API[5].
Σημασία και κληρονομιά
Το GPT‑4o έγινε ένα καμπύλο σημείο για την OpenAI — όχι τόσο για την απόλυτη υπεροχή σε κειμενικά benchmark (αύξηση 2–4 ποσοστιαίων μονάδων έναντι του GPT‑4 Turbo), αλλά για το παραδειγματικό άλμα προς εγγενή πολυτροπικότητα σε ενιαίο νευρωνικό δίκτυο[1]. Ακριβώς αυτή η αρχιτεκτονική κατέστησε εφικτά το Advanced Voice Mode με καθυστέρηση 320 ms, το Realtime API και την εγγενή δημιουργία εικόνων — λειτουργίες που καθόρισαν το προϊοντικό πρόσωπο του ChatGPT για ενάμιση χρόνο.
Η ιστορία του GPT‑4o σηματοδοτείται από αρκετά βασικά μαθήματα:
- Η αντίληψη των χρηστών για την «προσωπικότητα» του μοντέλου αποδείχθηκε κρίσιμη: η προσπάθεια βελτιστοποίησης του μοντέλου βάσει αξιολογήσεων χρηστών οδήγησε στην κρίση συκοφαντίας, ενώ η αφαίρεση του GPT‑4o υπέρ του GPT‑5 προκάλεσε μαζική διαμαρτυρία λόγω της απώλειας «ζεστού ύφους»[8][4].
- Οι ενημερώσεις snapshot δεν εγγυώνται βελτίωση — κάθε ένα από τα τρία κύρια snapshot έδειχνε τα ίδια ή χειρότερα αποτελέσματα σε ανεξάρτητες δοκιμές κωδικοποίησης[4].
- Το οικοσύστημα GPT‑4o με περισσότερες από 20 εξειδικευμένες παραλλαγές (audio‑preview, realtime‑preview, search‑preview, transcribe, TTS) επέδειξε τη στρατηγική της OpenAI για κατάτμηση του ενιαίου «omni» μοντέλου σε βελτιστοποιημένα τροπικά endpoint[3].
Δείτε επίσης
- GPT
- GPT‑4
- GPT‑4 Turbo
- GPT‑4o mini
- GPT‑5
- RLHF
- Αρχιτεκτονική Transformer
- Μεγάλα γλωσσικά μοντέλα
Βιβλιογραφία
- OpenAI (2024). Hello GPT‑4o. Επίσημο blog OpenAI, 13 Μαΐου 2024. https://openai.com/index/hello-gpt-4o/
- Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276. https://arxiv.org/abs/2410.21276
- OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 Ιουλίου 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- OpenAI. Models — GPT‑4o. Τεκμηρίωση API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- OpenAI (2025). Sycophancy in GPT‑4o. Postmortem. https://openai.com/index/sycophancy-in-gpt-4o/
- OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- OpenAI. GPT‑4o System Card PDF. https://cdn.openai.com/gpt-4o-system-card.pdf
- OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/
- OpenAI (2023). GPT‑4 Technical Report. arXiv:2303.08774. https://arxiv.org/abs/2303.08774
Σημειώσεις
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 OpenAI (2024). Hello GPT‑4o. Официальный блог OpenAI, 13 мая 2024. https://openai.com/index/hello-gpt-4o/
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 Hurst, A. et al. (2024). GPT‑4o System Card. arXiv:2410.21276, 25 октября 2024. https://arxiv.org/abs/2410.21276
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 3.17 3.18 3.19 3.20 3.21 3.22 3.23 3.24 3.25 3.26 3.27 3.28 OpenAI. Models — GPT‑4o. Документация API OpenAI. https://developers.openai.com/api/docs/models/gpt-4o
- ↑ 4.00 4.01 4.02 4.03 4.04 4.05 4.06 4.07 4.08 4.09 4.10 4.11 4.12 4.13 4.14 4.15 4.16 4.17 4.18 4.19 4.20 4.21 4.22 4.23 4.24 Wikipedia. GPT‑4o. https://en.wikipedia.org/wiki/GPT-4o
- ↑ 5.0 5.1 5.2 OpenAI (2026). Retiring GPT‑4o and older models. https://openai.com/index/retiring-gpt-4o-and-older-models/
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 OpenAI (2024). GPT‑4o mini: advancing cost‑efficient intelligence. 18 июля 2024. https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/
- ↑ 7.0 7.1 7.2 OpenAI (2024). Introducing Structured Outputs in the API. https://openai.com/index/introducing-structured-outputs-in-the-api/
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 OpenAI (2025). Sycophancy in GPT‑4o. Постмортем. https://openai.com/index/sycophancy-in-gpt-4o/
- ↑ 9.00 9.01 9.02 9.03 9.04 9.05 9.06 9.07 9.08 9.09 9.10 9.11 9.12 OpenAI. API Changelog. https://developers.openai.com/api/docs/changelog/