Πίσω στα RoboNews
▲ 106 πόντοιallanrbo.blogspot.com4 λεπτά ανάγνωσης•

Αξιοποίηση των logprobs για δομημένη εξαγωγή δεδομένων από LLMs και vision models

Πρωτότυπος τίτλος: "A single function Jev-like wrapper for LLMs, including vision models" (από allanrbo)

Αρχικό ΆρθροΣυζήτηση HN (30 σχόλια)
TL;DR (Εν Συντομία)

Η προσέγγιση αυτή χρησιμοποιεί τις πιθανότητες των tokens (logprobs) για την εξαγωγή δομημένων απαντήσεων από LLMs, παρακάμπτοντας την ανάγκη για παραγωγή μεγάλων κειμένων. Με την εφαρμογή αυτής της τεχνικής σε vision models, επιτυγχάνεται ευέλικτη ανάλυση εικόνας σε πραγματικό χρόνο με ελάχιστο latency.

📌 Κύρια Σημεία & Συμπεράσματα

  • Χρήση των logprobs για τον προσδιορισμό της βεβαιότητας του μοντέλου σε συγκεκριμένες επιλογές, αντί για την ανάλυση του παραγόμενου κειμένου.
  • Δραστική μείωση του latency μέσω του περιορισμού της παραγωγής σε ένα μόνο token (max_completion_tokens: 1).
  • Επέκταση της αρχιτεκτονικής Jev με υποστήριξη attachments για την επεξεργασία οπτικής πληροφορίας από κάμερες.
  • Δυνατότητα δυναμικής αλλαγής των κριτηρίων ανάλυσης μέσω απλών οδηγιών σε φυσική γλώσσα, χωρίς την ανάγκη εκπαίδευσης εξειδικευμένων μοντέλων computer vision.

Η αρχιτεκτονική προσέγγιση των logprobs

Η βασική ιδέα πίσω από αυτό το wrapper είναι η μετατροπή ενός LLM σε έναν μηχανισμό ταξινόμησης (classifier). Αντί να ζητάμε από το μοντέλο να συνθέσει μια απάντηση, το αναγκάζουμε να επιλέξει ανάμεσα σε προκαθορισμένες επιλογές (π.χ. [A], [B], [C]). Εξετάζοντας τις πιθανότητες (log probabilities) των tokens που αντιστοιχούν σε αυτές τις επιλογές, εξάγουμε μια ακριβή και μετρήσιμη απάντηση.

Εφαρμογή σε vision models και real-time επεξεργασία

Η προσθήκη ενός πεδίου attachments επιτρέπει την αποστολή frames από την κάμερα ως base64 encoded JPEGs. Σε συνδυασμό με το llama.cpp, η διαδικασία επιτρέπει την ανάλυση σκηνών σε πραγματικό χρόνο. Παρά το γεγονός ότι η επεξεργασία εικόνας είναι υπολογιστικά απαιτητική, ο περιορισμός της παραγωγής σε ένα μόνο token καθιστά το σύστημα εξαιρετικά αποδοτικό, επιτυγχάνοντας ρυθμό 1 FPS σε hardware επιπέδου RTX 3090.

Διαλειτουργικότητα και ευελιξία

Το σύστημα γεφυρώνει τις διαφορές μεταξύ των API (OpenAI vs llama.cpp) μέσω ενός ενιαίου interface. Η ευελιξία του έγκειται στο ότι ο χρήστης μπορεί να ορίσει οποιοδήποτε κριτήριο ανάλυσης (π.χ. ανίχνευση αντικειμένων, εκτίμηση φωτεινότητας) απλώς περιγράφοντάς το στο prompt. Αυτό καθιστά τη λύση ιδανική για πειραματισμούς όπου η ταχύτητα ανάπτυξης και η προσαρμοστικότητα υπερτερούν της απόλυτης βελτιστοποίησης ενός εξειδικευμένου μοντέλου computer vision.

Ετικέτες:#LLM#Computer Vision#Logprobs#Python#Performance
GitHub Gems & Trends

Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.

Εξερεύνηση Gems

Διαβάστε επίσης