Πίσω στα RoboNews
117 πόντοιcontrastive-lm.notion.site5 λεπτά ανάγνωσης

Ένας ταχύς και γενικευός Contrastive Language Model για λήψη αποφάσεων

Πρωτότυπος τίτλος: "Contrastive Language Models" (από erichocean)

Αρχικό ΆρθροΣυζήτηση HN (30 σχόλια)
TL;DR (Εν Συντομία)

Το Contrastive Language Model (CLM) είναι ένα νέο System One μοντέλο που χρησιμοποιείcontrastive learning για να συνδέει καταστάσεις και ενέργειες, επιτρέποντας ultra‑γρήγορη inference. Η CLM‑8B, που προεκπαιδεύεται σε 60M Q&A ζεύγη, μεσο‑εκπαιδεύεται με 30M synthetic hard negatives και post‑εκπαιδεύεται σε 1M agentic trajectories, φτάνει σε επίδοση παρόμοια με Jev αλλά με έως 9× χαμηλότερη latency και νέο SOTA σε βαθιά agentic benchmarks όπως DeepSWE (81,6%) και Terminal Bench 2.1 (87,6%). Η αρχιτεκτονική του χωρίζει τα embeddings των καταστάσεων και των ενεργειών, επιτρέποντας ανεξάρτητο caching και σημαντική μείωση του κόστους inference όταν το σύνολο ενεργειών είναι μεγάλο ή τα states αλλάζουν συνεχώς.

📌 Κύρια Σημεία & Συμπεράσματα

  • Η CLM składaται από δύο enconder (state encoder και action encoder) που είναι frozen LLM backbones + trainable projection heads (20M παραμέτρους); μόνο τα heads εκπαιδεύονται, κάτι που κάνει τα scaling experiments φθηνά.
  • Με τη διαχωριστική (disaggregated) αποθήκευση των embeddings, τα action embeddings μπορούν να προ‑υπολογιστούν και να επαναχρησιμοποιούνται, μειώνοντας το inference cost από 5 forward passes σε 1 ανά βήμα σε περιβάλλοντα όπως Super Mario ή WikiRacing.
  • Η εκπαίδευση erfolgt σε τρία στάδια: pre‑training σε 60M Nemotron Q&A pairs, mid‑training με 30M synthetic hard negatives (βελτιστοποίηση του InfoNCE loss) και post‑training σε 1M agentic trajectories, με co‑training replay για αποφυγή catastrophic forgetting.
  • Οι scaling laws δείχνουν ότι το test contrastive loss μειώνεται ως νόμος δύναμης του training compute, dataset size, projection‑head size και encoder size, wobei το scaling του encoder δίνει τις μεγαλύτερες κερδοσκοπίες.

Αρχιτεκτονική και μέθοδος antithetical training

Η Contrastive Language Model (CLM) αποτελείται από δύο ανεξάρτητα encoders: έναν για την κατάσταση (state encoder) και έναν για την ενέργεια (action encoder). Κάθε encoder είναι ένα frozen LLM backbone (π.χ. Qwen3‑8B) ακολουθούμενο από ένα trainable projection head που μετατρέπει το κρυφό διάνυσμα του τελευταίου token σε ένα κοινό embedding space. Μόνο τα projection heads (περίπου 20M παραμέτρους) λαμβάνουν gradients κατά την εκπαίδευση, ενώ τα LLM backbones μένουν αμετάβλητα. Η loss function είναι bidirectional InfoNCE, η οποία ενισχύει την podobάσει μεταξύ σωστών state–action ζευγών και τα αποσυνειράει από τα λάθος. Για το mid‑training προστίθενται hard negatives, βελτιστοποιώντας την διάκριση μεταξύ plausible actions.

Αποδοτικό caching και disaggregation of states/actions

Ένα κλειδί της CLM είναι η disaggregation των embeddings: τα state και action embeddings υπολογίζονται και αποθηκεύονται ανεξάρτητα. Σε σενάρια όπου το σύνολο ενεργειών είναι σταθερό ή αλλάγει σπάνια (π.χ. παιχνίδι Super Mario, WikiRacing), τα action embeddings προ‑υπολογίζονται einmal και χρησιμοποιούνται ξανά σε κάθε βήμα, ενώ μόνο το νέο state embedding υπολογίζεται κάθε φορά. Αυτό μειώνει το inference cost από πολλαπλά forward passes σε ένα μόνο, με τα ωφέλεια να αυξάνονται όταν ο αριθμός των candidate actions ή το context length μεγαλώνει (μέχρι 13x ταχύτερη από Jev bei ~1k actions). Η διαλειτουργικότητα (interoperability) του caching μηχανισμού επιτρέπει εύκολη ενσωμάτωση σε υπάρχοντα serving pipelines χωρίς αλλαγή του μοντέλου.

Κλιμάκωση και scaling laws

Οι δοκιμές scaling δείχνουν ότι το test contrastive loss L ακολουθεί έναν νόμον δύναμης: L ≈ (Xc/X)^αX για κάθε παράγοντα X ∈ {training compute C, dataset size D, projection‑head size N, encoder size N_enc}. Όταν κα παράγοντας δεν είναι bottleneck, το scaling exponent αX είναι σταθερό. Τα πειράματα δείχνουν ότι η αύξηση του encoder size παρέχει τις μεγαλύτερες βελτιώσεις στην απόδοση, ενώ το optimal projection‑head size αυξάνεται σχεδόν γραμμικά με τον αριθμό των training tokens (≈ 310 tokens per parameter). Αυτή η συμπεριφορά επιτρέπει ακριβή πρόβλεψη της απόδοσης σε μεγαλύτερα μοντέλα χωρίς την ανάγκη για εκτεταγμένα re‑training.

Εφαρμογές και αποτελέσματα σε agentic benchmarks

Μετά το post‑training σε 1M agentic trajectories (ADP dataset, Endless‑Terminals, LiteCoder‑Terminal‑SFT) και με co‑training replay (40% Nemotron DQA + 60% agentic data), η CLM‑8B φτάνει σε SOTA επίδοση σε βαθιά agentic coding benchmarks: DeepSWE 81,6% και Terminal Bench 2.1 87,6%, ενώ παρέχει 4–6× ταχύτερη inference από Jev. Σε computer‑use, gaming και tool‑calling tasks η CLM‑8B είναι παρόμοια με Jev σε accuracy αλλά με έως 9× χαμηλότερη latency, ωφέλιμη ειδικά όταν ο αριθμός των candidate actions είναι μεγάλο ή οι actions μπορούν να χρησιμοποιηθούν ξανά σε διάφορες states. Το παρεχόμενο playground στο GitHub επιτρέπει στους developers να δοκιμάζουν το μοντέλο σε πραγματικό χρόνο, βλέποντας την πλήρη κατανομή πιθανότητας über τις ενέργειες σε milliseconds.

Ετικέτες:#Contrastive Learning#LLM#Agentic AI#Inference Optimization#Scaling Laws
GitHub Gems & Trends

Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.

Εξερεύνηση Gems

Διαβάστε επίσης