Αξιοποίηση των logprobs για δομημένη εξαγωγή δεδομένων από LLMs και vision models
Πρωτότυπος τίτλος: "A single function Jev-like wrapper for LLMs, including vision models" (από allanrbo)
Η προσέγγιση αυτή χρησιμοποιεί τις πιθανότητες των tokens (logprobs) για την εξαγωγή δομημένων απαντήσεων από LLMs, παρακάμπτοντας την ανάγκη για παραγωγή μεγάλων κειμένων. Με την εφαρμογή αυτής της τεχνικής σε vision models, επιτυγχάνεται ευέλικτη ανάλυση εικόνας σε πραγματικό χρόνο με ελάχιστο latency.
Η αρχιτεκτονική προσέγγιση των logprobs
Η βασική ιδέα πίσω από αυτό το wrapper είναι η μετατροπή ενός LLM σε έναν μηχανισμό ταξινόμησης (classifier). Αντί να ζητάμε από το μοντέλο να συνθέσει μια απάντηση, το αναγκάζουμε να επιλέξει ανάμεσα σε προκαθορισμένες επιλογές (π.χ. [A], [B], [C]). Εξετάζοντας τις πιθανότητες (log probabilities) των tokens που αντιστοιχούν σε αυτές τις επιλογές, εξάγουμε μια ακριβή και μετρήσιμη απάντηση.
Εφαρμογή σε vision models και real-time επεξεργασία
Η προσθήκη ενός πεδίου attachments επιτρέπει την αποστολή frames από την κάμερα ως base64 encoded JPEGs. Σε συνδυασμό με το llama.cpp, η διαδικασία επιτρέπει την ανάλυση σκηνών σε πραγματικό χρόνο. Παρά το γεγονός ότι η επεξεργασία εικόνας είναι υπολογιστικά απαιτητική, ο περιορισμός της παραγωγής σε ένα μόνο token καθιστά το σύστημα εξαιρετικά αποδοτικό, επιτυγχάνοντας ρυθμό 1 FPS σε hardware επιπέδου RTX 3090.
Διαλειτουργικότητα και ευελιξία
Το σύστημα γεφυρώνει τις διαφορές μεταξύ των API (OpenAI vs llama.cpp) μέσω ενός ενιαίου interface. Η ευελιξία του έγκειται στο ότι ο χρήστης μπορεί να ορίσει οποιοδήποτε κριτήριο ανάλυσης (π.χ. ανίχνευση αντικειμένων, εκτίμηση φωτεινότητας) απλώς περιγράφοντάς το στο prompt. Αυτό καθιστά τη λύση ιδανική για πειραματισμούς όπου η ταχύτητα ανάπτυξης και η προσαρμοστικότητα υπερτερούν της απόλυτης βελτιστοποίησης ενός εξειδικευμένου μοντέλου computer vision.
Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.