Πίσω στα GitHub Gems
Προστέθηκε: 26 Σεπτεμβρίου 2026 (πριν από 1 ημέρα)
11,911 stars1,960 forksTrendingPython
LMCache/LMCache

LMCache: Σύστημα διαμοιραζόμενης μνήμης για επιτάχυνση του KV cache σε LLM

Προβολή στο GitHub
Ιστοσελίδα

Συνοπτική Εικόνα

Το LMCache είναι ένα middleware που επιτρέπει τον διαμοιρασμό και την αποθήκευση του KV cache μεταξύ διαφορετικών instances μοντέλων παραγωγικής τεχνητής νοημοσύνης (Generative AI), μειώνοντας δραστικά το latency και το TTFT (Time To First Token).

Γιατί ξεχωρίζει

Ξεχωρίζει για την ικανότητά του να αποσυνδέει το KV cache από το συγκεκριμένο GPU instance, επιτρέποντας την επαναχρησιμοποίηση context σε κατανεμημένα περιβάλλοντα και βελτιώνοντας τη διαλειτουργικότητα (interoperability) με το vLLM.

Ετικέτες:#amd#cuda#fast#inference#kv-cache#llm#pytorch#rocm#speed#vllm

##Τι είναι και τι πρόβλημα λύνει

Στα μεγάλα γλωσσικά μοντέλα (LLMs), το KV cache αποτελεί συχνά το κύριο σημείο συμφόρησης (bottleneck) κατά την επεξεργασία μεγάλων context. Το LMCache επιλύει αυτό το πρόβλημα εισάγοντας ένα επίπεδο διαχείρισης μνήμης που επιτρέπει την αποθήκευση και τον διαμοιρασμό των υπολογισμένων states μεταξύ διαφορετικών instances, αποφεύγοντας την περιττή επαναϋπολογιστική διαδικασία.

##Βασικά χαρακτηριστικά

  • Distributed KV Caching: Δυνατότητα διαμοιρασμού του cache μέσω ενός κεντρικού backend, επιτρέποντας σε πολλαπλά vLLM instances να επωφελούνται από ήδη επεξεργασμένα prompts.
  • Seamless Integration: Σχεδιασμένο για άμεση ενσωμάτωση με το vLLM, επιτρέποντας τη χρήση του μέσω απλών ρυθμίσεων σε αρχεία YAML.
  • Hardware Agnostic: Υποστήριξη για CUDA και ROCm, εξασφαλίζοντας ευελιξία σε διαφορετικά περιβάλλοντα GPU.

##Σε ποιους απευθύνεται

Απευθύνεται σε AI engineers και MLOps που διαχειρίζονται συστήματα inference μεγάλης κλίμακας και αναζητούν τρόπους να βελτιστοποιήσουν το throughput και να μειώσουν το κόστος υπολογιστικών πόρων σε εφαρμογές με μεγάλο context window.

Περισσότερα GitHub Gems

RoboNews — Hacker News Digest

Διαβάστε τις κορυφαίες συζητήσεις και άρθρα τεχνολογίας συνοψισμένα στα Ελληνικά.

Όλα τα άρθρα RoboNews