Σε GPU inference pod, η χρήση CPU μπορεί να είναι παραπλανητική, καθώς μπορεί να παραμένει στο 30% την ώρα που ο accelerator είναι ήδη πλήρως απασχολημένος και τα αιτήματα συσσωρεύονται.
Το κρίσιμο σήμα για την κλιμάκωση είναι αυτό που βρίσκεται πραγματικά στο μονοπάτι εκτέλεσης: το backlog και η GPU utilization. Για αυτό το σημείο αναφέρεται η χρήση του KEDA.
Ποιο σήμα μετρά περισσότερο στην κλιμάκωση;
Στο συγκεκριμένο σενάριο, το CPU δεν αποτυπώνει την πίεση του συστήματος. Αντίθετα, το backlog δείχνει ότι τα αιτήματα περιμένουν, ενώ η GPU utilization αποτυπώνει την κατάσταση του accelerator.
- CPU ως decorrelated proxy
- Backlog ως ένδειξη συσσώρευσης αιτημάτων
- GPU utilization ως βασικό σήμα φόρτου
- KEDA για το autoscaling
Γιατί το CPU μπορεί να οδηγήσει σε λάθος εικόνα;
Το άρθρο αναφέρει ότι σε ένα GPU inference pod το CPU μπορεί να βρίσκεται χαμηλά, ακόμη και στο 30%, την ίδια στιγμή που η GPU έχει φτάσει στο όριό της. Σε αυτή την περίπτωση, η κατάσταση του συστήματος δεν αποτυπώνεται σωστά από το CPU.
Γι’ αυτό το autoscaling δεν πρέπει να στηρίζεται σε ένα σήμα που δεν βρίσκεται στο κρίσιμο μονοπάτι.
Τι δείχνει το παράδειγμα ενός model-serving service;
Το υλικό κάνει αναφορά σε ένα model-serving service στο οποίο ο συντάκτης ήταν on-call, με τίτλο «The Autoscaler That Watched the Queue Burn». Από αυτό το παράδειγμα προκύπτει η ανάγκη να παρακολουθείται η ουρά και η GPU, όχι να βασίζεται κανείς μόνο σε δευτερεύοντα σήματα.
Η βασική κατεύθυνση είναι σαφής: κλιμάκωση με βάση το backlog και τη GPU utilization, όχι με βάση το CPU όταν αυτό δεν αντικατοπτρίζει το πραγματικό φορτίο.
Ποια είναι η πρακτική οδηγία που προκύπτει;
Η οδηγία που δίνεται είναι να γίνεται scaling στο σήμα που βρίσκεται πάνω στο κρίσιμο μονοπάτι. Στο συγκεκριμένο περιβάλλον αυτό σημαίνει backlog και GPU utilization, με το KEDA να χρησιμοποιείται ως εργαλείο autoscaling.
Το μήνυμα του άρθρου είναι να επιλέγονται metrics που αντικατοπτρίζουν την πραγματική πίεση του AI workload.















