Τα γράμματα (tokens) γίνονται τόσο φθηνά που δεν μπορούν να μετρηθούν
Πρωτότυπος τίτλος: "Tokens Too Cheap to Meter" (από teoruiz)
Το άρθρο δείχνει ότι το κόστος για να ολοκληρώσουμε μια εργασία με μοντέλα μηχανικής μάθησης μειώνεται εκθετικά, λόγω βελτιώσεων σε GPU, inference engines και νέες αρχιτεκτονικές όπως MoE και Mamba. Σε λίγα χρόνια τα tokens θα γίνουν φθηνά enough ώστε να ανταγωνιστούν ή να ξεπερνούν το κόστος παραδοσιακών εργαλείων όπως το grep ή το cargo build.
Η εξέλιξη του κόστους των μοντέλων
Το κόστος για να ολοκληρώσουμε μια εργασία με ένα μοντέλο μετράται σε dollars per task, όχι ανά token. Τα frontier μοντέλα (π.χ. GPT‑5.6 Luna) έχουν δείξει μειωση κόστους ανά κατά περίπου 100× το τελευταίο έτος, όπως φαίνεται στον Pareto frontier του 2025‑2026. Αυτό σημαίνει ότι για το ίδιο ποσό μπορούμε να τρέχουμε μοντέλα που είναι πολύ πιο έξυπνα ή να μειώνουμε το κόστος για το ίδιο επίπεδο ποιότητας.
Βελτιώσεις στον υλικό και τις inference engines
Η ενεργειακή απόδοση των GPU αυξάνεται εκθετικά: ο λόγος 1.3 στον γραφικό κατεύθυνση σημαίνει διπλασιασμό κάθε δύο χρόνια, μια εξέλιξη παρόμοια με τη νόμο του Moore στα τέσσερα‑πάντα χρόνια. Τα inference engines όπως το vLLM βελτιώνουν την joule/token απόδοση τους 40 % σε 15 μηνες, ενώ το NVIDIA MLPerf stack και το Intel δείχνουν παρόμοιες βελτιώσεις σε throughput και ενεργειακή απόδοση.
Ειδικές αρχιτεκτονικές που μειώνουν τις απαιτήσεις
Mixture‑of‑Experts (MoE): ενεργοποιεί μόνο τα εξPERT layers που χρειάζονται, μειώνοντας τον υπολογισμό κατά 7× για την ίδια ποιότητα. Mamba αντικαθιστά το πλήρες ιστορικό των tokens με μια lossy περίληψη, μειώνοντας την ανάγκη RAM κατά 5× ή περισσότερο. Ο κβαντισμός (quantization) από 16‑bit σε 4‑bit μειώνει το μέγεθος του μοντέλου με ελάχιστη απώλεια ποιότητας, κάτι που επιτρέπει σε μοντέλα όπως το Nemotron‑H‑47B να κρατήσουν εκατομμύρια tokens σε 32 GB VRAM.
Επιπτώσεις και μελλοντικές τάσεις
Όταν το κόστος ενός token πέσει κάτω από το κόστος μιας βασικής εντολής (π.χ. grep, που κοστίζει ~0.000007 ¢), γίνεται οικονομικά λερό να ενσωματώνουμε ML εργαλεία. Έχουμε ήδη παραδείγματα όπως το jgrep, το οποίο δίνει πιθανότητα σε 200 ms για ένα τετάρτο του cents. Αυτό ενθαρρύνει την παρουσίαση του supply‑side Jevons Paradox: όσο τα tokens γίνονται φθηνά, οι εταιρείες χτίζουν περισσότερο compute, αυξάνοντας το συνολικό ζήτημα. Από την πλευρά της ζήτησης, αναμένουμε ML να γίνει το προεπιλεγμένο «υλικό» για εργαλεία build scheduling, cybersecurity, και product development, μετατοπίζοντας την αξία από pur‑algorithms σε QA, UI/UX και λειτουργίες.
Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.