Πίσω στα RoboNews
117 πόντοιevaluation.club4 λεπτά ανάγνωσης

Οι προτροπές δεν είναι το πράγμα: κερδίζει η αξιολόγηση

Πρωτότυπος τίτλος: "Prompts aren’t Real" (από mcfunley)

Αρχικό ΆρθροΣυζήτηση HN (56 σχόλια)
TL;DR (Εν Συντομία)

Το άρθρο υποστηρίζει ότι η ποιότητα ενός agentic συστήματος δεν καθορίζεται από το κείμενο μιας προτροπής, αλλά από το σύστημα μέτρησης, δοκιμών και αυτοβελτίωσης που την περιβάλλει. Σε περιβάλλον παραγωγής, οι ειδικοί του πεδίου πρέπει να κατασκευάζουν αξιόπιστα δεδομένα αξιολόγησης και βρόχους ανατροφοδότησης, αντί να επιδιώκουν τη θεωρητικά τέλεια προτροπή.

📌 Κύρια Σημεία & Συμπεράσματα

  • Ακόμη και τα ισχυρότερα μοντέλα παραβιάζουν περιορισμούς σχήματος, ορίων κειμένου και κλήσεων εργαλείων σε μικρό αλλά σταθερό ποσοστό αιτημάτων.
  • Ένα prompt λειτουργεί μέσα σε ένα ευρύτερο και μεταβαλλόμενο πλαίσιο, οπότε η αλλαγή του μπορεί να διαταράξει συμπεριφορές που θεωρούνταν σταθερές.
  • Η παραγωγική αξιοπιστία επιτυγχάνεται με επαναλαμβανόμενες δοκιμές, adversarial scenarios, βελτιστοποίηση prompt και ξεχωριστά holdout datasets.
  • Δοκιμές παραγωγής και LLM judges μπορούν να τροφοδοτούν έναν αυτορρυθμιζόμενο βρόχο βελτίωσης, όπου οι άνθρωποι ορίζουν τα κριτήρια ποιότητας αντί να χειριστούν τυφλά τα prompts.

Από το chatbot στο αξιόπιστο agent

Τα LLMs μπορούν να παράγουν εντυπωσιακά και χρήσιμα αποτελέσματα, αλλά η αξιοπιστία τους δεν αυξάνεται αυτόματα με την κλίμακα ή με την επιβολή δομημένου output. Τα μοντέλα συνεχίζουν να παραβιάζουν συμβάσεις όπως το μέγιστο μήκος ενός πεδίου, η ακριβής σύνταξη JSON, η σωστή χρήση ενός tool ή η συμμόρφωση με έναν ρόλο. Ακόμη και όταν το σφάλμα εμφανίζεται σπάνια, η επανάληψη των αιτημάτων σε πραγματική εφαρμογή το μετατρέπει σε προβληματικό σταθερό φαινόμενο.

Τα agents διαφέρουν από τα απλά chatbots επειδή εκτελούν εργασίες για λογαριασμό του χρήστη. Αυτό αυξάνει την ευθύνη του συστήματος: δεν αρκεί μια απάντηση να ακούγεται σωστά· πρέπει να παραμένει εντός ορίων, να σέβεται πολιτικές ασφάλειας και να ολοκληρώνει το καθήκον χωρίς απρόβλεπτες εκτροπές.

Γιατί η επιμέλεια ενός prompt είναι ασταθής στρατηγική

Ένα prompt δεν αποτελεί ανεξάρτητο αντικείμενο. Εκτελείται μαζί με όλες τις προηγούμενες οδηγίες, το context του agent, τα διαθέσιμα εργαλεία, τις αλλαγές στο μοντέλο και πιθανές παρενέργειες από νέα χαρακτηριστικά. Έτσι, η προσθήκη μιας φαινομενικά μικρής προτροπής μπορεί να αλλάξει σημαντικά τη συμπεριφορά ολόκληρου του συστήματος. Ακόμη και μια απλή ονομαστική αλλαγή σε πεδίο structured output μπορεί να βελτιώσει προσωρινά την απόδοση, χωρίς να αποδεικνύει ότι κατανοήσαμε το πρόβλημα.

Η πρακτική «η ομάδα εταιρικής ταυτότητας να επιμελείται τις προτροπές ταυτόνου» αποτυγχάνει σε μεγάλη κλίμακα, επειδή δεν παρέχει τρόπο να γνωρίζουμε αν μια προτροπή λειτούργησε ή απλώς πέρασε από μια συγκεκριμένη δοκιμή. Το κείμενο είναι ενδεχόμενα χρήσιμο, αλλά δεν είναι η ουσιαστική μονάδα αξιοπιστίας.

Ο βρόχος μέτρησης και αυτοβελτίωσης

Η εναλλακτική είναι να μετατραπεί η ποιότητα σε μετρήσιμη ιδιότητα. Ο βασικός μηχανισμός είναι οι επαναλαμβανόμενες δοκιμές, γνωστές ως pass^k: το σύστημα εκτελείται πολλές φορές και καταγράφει πόσο συχνά περνά ένα συγκεκριμένο κριτήριο. Η διαδικασία περιλαμβάνει:

  1. Καταγραφή της τρέχουσας απόδοσης και δημιουργία adversarial scenarios από ανθρώπους ειδικούς του πεδίου και βοηθητικά από LLM.
  2. Σύγκριση του agent με και χωρίς τη νέα οδηγία ή «skill», ώστε να διαπιστωθεί αν προσθέτει πραγματική αξία ή διαταράσσει υφιστάμενες συμπεριφορές.
  3. Βελτιστοποίηση του prompt μέσω αλγορίθμου όπως το GEPA, ο οποίος αναλύει τις αποτυχίες στις δοκιμές και προτείνει επαναληπτικές τροποποιήσεις.
  4. Δοκιμή σε ανεξάρτητα holdout scenarios, ώστε να αποφευχθεί το overfitting στις ασκήσεις που χρησίμευσαν για τη βελτιστοποίηση.
  5. Επαναληπτική εκτέλεση του βρόχου μέχρι η απόδοση να σταθεροποιηθεί και στα δύο σύνολα δοκιμών.

Ο τελικός οδηγός μπορεί να μοιάζει ακατανόητος ή υπερβολικά εξειδικευμένος με το αρχικό. Αυτό δεν είναι απαραίτητα πρόβλημα, εφόσον η συμπεριφορά του επιβεβαιώνεται από ευρύ και αντιπροσωπευτικό σύνολο μετρήσεων. Το κρίσιμο προϊόν δεν είναι το κείμενο, αλλά η σχέση ανάμεσα σε αυτό και τις δοκιμές που το ελέγχουν.

Αξιολόγηση παραγωγής και ο νέος ρόλος των ειδικών

Οι δοκιμές μπορούν να είναι απλές όταν το αποτέλεσμα είναι Deterministic, όπως η κλήση ενός συγκεκριμένου εργαλείου. Για πιο σύνθετα κριτήρια, όπως η εταιρική φωνή ή ο νομικός τόνος, μπορεί να χρησιμοποιηθεί LLM judge. Όταν όμως η εκτίμηση είναι ιδιαίτερα υποκειμενική, ακόμη και ο κριτής χρειάζεται golden dataset με χειροκίνητα ετικαρισμένα σωστά και λάθος παραδείγματα και δική του διαδικασία βελτιστοποίησης.

Σε παραγωγή, οι ίδιες οι δοκιμές μπορούν να εκτελούνται κατά τις αναφορές, ενώ τα LLM judges εξετάζουν δειγματοληπτημένες συνομιλίες. Οι περιπτώσεις που αποτυγχάνουν μετατρέπονται σε νέα hard cases, τα οποία εντάσσονται στις επόμενες εκδόσεις του dataset και επανεκκινούν τον βρόχο βελτιστοποίησης.

Η αρχή για προϊόν discovery μπορεί να είναι απλούστερη: ένα αρχικό skill χωρίς πλήρη αξιολόγηση μπορεί να είναι αποδεκτό σε μη παραγωγικό περιβάλλον. Για συστήματα που επηρεάζουν πραγματικούς χρήστες, όμως, η ασφάλεια και η αξιοπιστία πρέπει να βασίζονται σε παρακολούθηση χρήσης, labeled datasets, σταθερά κριτήρια ποιότητας και αυτορρυθμιζόμενους βρόχους. Οι άνθρωποι με γνώση του πεδίου δεν πρέπει να παλεύουν για τη «τέλεια» προτροπή· πρέπει να ορίζουν τι σημαίνει σωστή συμπεριφορά και να κατασκευάζουν τα μέσα με τα οποία αυτή μετριέται.

Ετικέτες:#AI#Machine Learning#Engineering
GitHub Gems & Trends

Ανακαλύψτε καινοτόμα open-source εργαλεία και κρυμμένα διαμάντια ανοιχτού κώδικα.

Εξερεύνηση Gems

Διαβάστε επίσης