Η IBM Granite έδωσε στη δημοσιότητα τις λεπτομέρειες για τα Granite 4.2, την πρώτη της οικογένεια dense, decoder-only reasoning LLMs, που κυκλοφορεί σε τρία μεγέθη: 3B, 8B και 30B. Όλα τα μοντέλα έχουν εκπαιδευτεί από το μηδέν σε περίπου 15 τρισ. tokens, με πενταφασική στρατηγική, context window έως 512K tokens και multi-stage reinforcement learning pipeline.
Τι περιλαμβάνει η νέα οικογένεια Granite 4.2;
Η σειρά Granite 4.2 είναι η reasoning-focused έκδοση της οικογένειας γλωσσικών μοντέλων Granite. Σύμφωνα με το υλικό, τα προηγούμενα Granite είχαν ισχυρή συμπεριφορά ως assistants που ακολουθούν οδηγίες, ενώ η νέα έκδοση προσθέτει explicit reasoning.
📖 Διάβασε επίσης
Και τα τρία μοντέλα μοιράζονται τον ίδιο αρχιτεκτονικό σχεδιασμό και το ίδιο training pipeline, με την κλίμακα να διαφέρει ανά έκδοση.
- 3B μοντέλο
- 8B μοντέλο
- 30B μοντέλο
Πώς εκπαιδεύτηκαν τα μοντέλα από το μηδέν;
Η IBM αναφέρει ότι τα Granite 4.2 εκπαιδεύτηκαν από την αρχή πάνω σε περίπου 15 τρισ. tokens. Η διαδικασία ακολούθησε πενταφασική στρατηγική, ενώ οι φάσεις 1–2 επικεντρώθηκαν στο foundational pre-training.
Σύμφωνα με το υλικό, οι φάσεις 3–4 προχώρησαν σε mid-training, ενώ η συνολική διαδικασία περιλαμβάνει επίσης supervised fine-tuning και multi-stage reinforcement learning.
Ποιος είναι ο ρόλος του supervised fine-tuning και του RL;
Μετά το pre-training, τα μοντέλα περνούν από supervised fine-tuning πάνω σε chain-of-thought, reasoning και agentic-trajectory δεδομένα. Στη συνέχεια ακολουθεί post-training με multi-stage reinforcement learning pipeline.
Για τα 8B και 30B, η IBM προσθέτει και agentic RL block, στο οποίο τα μοντέλα μαθαίνουν να ενεργούν με εργαλεία μέσα σε πραγματικά sandboxed environments.
- chain-of-thought δεδομένα
- reasoning δεδομένα
- agentic-trajectory δεδομένα
- agentic RL για 8B και 30B
Τι δυνατότητες έχουν τα Granite 4.2;
Κάθε μοντέλο μπορεί να παράγει chain of thought πριν από την απάντησή του και να λειτουργεί σε thinking ή non-thinking mode, ανάλογα με το πόση σκέψη απαιτεί η εργασία. Υπάρχει επίσης low-effort thinking mode, που καταναλώνει μικρό reasoning budget για εύκολες ερωτήσεις.
Όλα τα Granite 4.2 υποστηρίζουν native tool calling. Όταν σερβίρονται μέσω OpenAI-compatible endpoint, όπως με vLLM, στέλνουν tool calls σε μορφή OpenAI function-calling και συνδέονται με agentic harnesses χωρίς επιπλέον glue.
Πού ξεχωρίζουν τα 8B και 30B μοντέλα;
Η πιο καθαρή διαφορά εμφανίζεται στο post-training. Τα 8B και 30B περνούν από επιπλέον agentic RL εκπαίδευση, η οποία τα μαθαίνει να λειτουργούν ως agents με εργαλεία, επεξεργασία και εκτέλεση κώδικα, χρήση terminal και αναζήτηση στο web μέσα σε πραγματικά environments.
Το υλικό αναφέρει επίσης ότι το Granite 4.2 υποστηρίζεται και στο SGLang, με σχετικό cookbook για έτοιμη ρύθμιση.
- calling tools
- editing and running code
- driving a terminal
- searching the web
Με ποια άδεια κυκλοφορούν τα Granite 4.2;
Όλα τα Granite 4.2 μοντέλα κυκλοφορούν με άδεια Apache 2.0. Η IBM περιγράφει την έκδοση ως reasoning release της οικογένειας Granite και δηλώνει ότι το υπόλοιπο υλικό της ανάρτησης καλύπτει την αρχιτεκτονική, το pre-training, το supervised fine-tuning, το multi-stage RL pipeline και τα αποτελέσματα.















