Πίσω στα RoboNews
418 πόντοιopenai.com5 λεπτά ανάγνωσης

GPT‑6 Sol και Luna: οικονομικά αποδοτικές εκδόσεις του GPT‑6

Πρωτότυπος τίτλος: "GPT-6 Sol and Luna" (από OfficialTurkey)

Αρχικό ΆρθροΣυζήτηση HN (221 σχόλια)
TL;DR (Εν Συντομία)

Η OpenAI apresentou τα GPT‑6 Sol και Luna, δύο νέα μοντέλα της οικογένειας GPT‑6 που προσφέρουν 50 % χαμηλότερες τιμές API σε σύγκριση με τις προωθητικές τιμές του GPT‑5.6, ενώ κρατούν υψηλή απόδοση σε επαγγελματικές εργασίες, κωδικοποίηση και χρήση υπολογιστή. Τα μοντέλα βελτιώνουν το prompt caching, την alignment και τη διαλειτουργικότητα (interoperability) με τα εργαλεία, καθιστώντας την προχωρημένη AI πιο προσępτη για κλιμακωθείς εφαρμογές.

📌 Κύρια Σημεία & Συμπεράσματα

  • Τα GPT‑6 Sol και Luna χρεώνονται $2 / $10 ανά 1 M tokens εισόδου/εξόδου αντί για $4 / $20 του GPT‑5.6, δηλαδή 50 % μείωση κόστους.
  • Στην AutomationBench, το GPT‑6 Sol με xhigh effort πετυχαίνει 33,2 % σκορ με κόστος ανά 0,27 $, outperforming Claude Opus 5 (max) που κοστίζει 11,1× περισσότερο.
  • Το βελτιωμένο prompt caching δίνει 90 % έκπτωση στην ανάγνωση cached input‑tokens και μειώνει το ποσοστό tokens που χρειάζονται fresh processing κατά από 50 % σε δισεκατομμύρια αίτηματα.
  • Η alignment του Sol και Luna βελτιώθηκε σε σχέση με το GPT‑5.6, μειώνοντας τις ποσότητες misleading claims στην κωδικοποίηση, ενώ τα μοντέλα διατηρούν παρόμοια factuality και coding performance με το GPT‑6 Astra αλλά με πολύ χαμηλότερο κόστος.

Εισαγωγή και νέο τιμολόγιο

Η OpenAI.extend την οικογένεια GPT‑6 με τα GPT‑6 Sol και GPT‑6 Luna, δύο μοντέλα που κληρονομούν τις προgresses του GPT‑6 Astra σε reasoning, factuality, coding και computer use, αλλά προσφέρονται σε πολύ χαμηλότερη τιμή. Οι τιμές API είναι $2 ανά 1 M input tokens και $10 ανά 1 M output tokens για το Sol, και $0,10 / $0,50 για το Luna – ακριβώς 50 % λιγότερο από τις προωθητικές τιμές του GPT‑5.6. Η μείωση αυτή είναι αποτέλεσμα βελτιώσεων στο caching και στο inference pipeline που επιτρέκουν την παροχή των μοντέλων σε μεγαλύτερη κλίμακα με χαμηλότερο κόστος.

Αξιολόγηση απόδοσης σε πραγματικούς εργαζόμενους

Στην AutomationBench, η οποία μετράει end‑to‑end business workflows σε 47 εργαλεία, το GPT‑6 Sol (xhigh effort) φτάνει 33,2 % σκορ με κόστος $0,27 ανά . Σε σύγκριση, το Claude Opus 5 (max) φτάνει 26,9 % αλλά κοστίζει 11,1× περισσότερο, ενώ το GPT‑6 Astra (low effort) 30,3 % σκορ αλλά 3,9× το κόστος του Sol. Σε Agents’ Last Exam, το Sol (max effort) πετυχαίνει 56,4 % με 60 % χαμηλότερο κόστος από το Claude Opus 5.

Στην FrontierCode (αξιολόγηση κώδικα που είναι έτοιμος για merge), το Sol βελτιώνεται σημαντικά σε σχέση με το GPT‑5.6 Sol και ισοβαθμεί με το Claude Fable 5.1 xhigh, ενώ το κόστος είναι πολύ χαμηλότερο. Στην DeepSWE v1.1, το Sol (max effort) φτάνει 68,8 % – μόλις 1,1 ponto κάτω από το κορυφαίο 69,9 % του Claude Fable 5 – με περίπου 80 % χαμηλότερο κόστος ανά . Το Luna (max effort) φτάνει 66,6 %, ισοβαθμεί με το Claude Opus 5 και Fable 5 σε medium effort, αλλά κοστίζει 93 % λιγότερο από Opus 5 και 96 % λιγότερο από Fable 5.

Βελτιώσεις caching, alignment και διαλειτουργικότητα

Το prompt caching αναβαθμίστηκε ώστε να αυξάνει το ποσοστό cache hits προεπιλογής, προσφέροντας 90 % έκπτωση στην ανάγνωση cached input‑tokens. Τα developers μπορούν να παρακολουθούν την απόδοση caching μέσω του Prompt Caching Dashboard και του diagnostics tool, να ρυθμίζουν το reasoning effort (μοντέλα συλλογιστικής (reasoning models)) και την διαθεσιμότητα εργαλείων χωρίς να χαλάνε το cache, καθώς και να ορίζουν explicit breakpoints για το ποιο πρόθεμα θα cache‑αριστεί. Τα βελτιώματα έχουν μειώσει το ποσοστό tokens που χρειάζουν fresh processing κατά più του 50 % σε δισεκατομμύρια αιτήματα, βοηθώντας το GitHub Copilot να γίνει πιο γρήγορο.

Η alignment του Sol και Luna βασίζεται στην εργασία που ξεκίνησε με το GPT‑6 Astra. Στα interna coding deception evaluations, το índice της απάτης μειώθηκε, ενώ η factuality bleef σε επίπεδα κοντά στο Astra αλλά με πολύ χαμηλότερο κόστος. Επιπλέον, το μοντέλο διατηρεί τη διαλειτουργικότητα (interoperability) με τα εργαλεία: η ενεργοποίηση ή απενεργοποίηση εργαλείων, ή η αλλαγή του reasoning effort, δεν διακόπτει την επαναχρησιμοποίηση του cached context.

Διαθεσιμότητα και χρήση στο OpenAI API

Τα GPT‑6 Sol και Luna είναι διαθέσιμα από σήμερα στο ChatGPT Work και το Codex για όλους τους Plus, Pro, Business, Enterprise και Edu χρήστες. Οι Free και Go χρήστες μπορούν να έχουν πρόσβαση στο Luna μέσω της desktop app. Τα μοντέλα δεν είναι ακόμα διαθέσιμα στο τυπικό Chat, αλλά στην OpenAI API είναι προσβάσιμα ως gpt-6-sol και gpt-6-luna. Η ανάπτυξη θα γίνει progressively κατά τη διάρκεια της ημέρας για να διατηρηθεί η σταθερότητα της υπηρεσίας.

Ετικέτες:#LLM#API#Performance#Caching
GitHub Gems & Trends

Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.

Εξερεύνηση Gems

Διαβάστε επίσης