Το PerceptionBench της Moonshot AI αξιολογεί πόσο καλά τα multimodal AI μοντέλα μπορούν πραγματικά να «δουν», ξεχωριστά από τη λογική τους σκέψη. Σύμφωνα με τα αποτελέσματα, κανένα frontier model δεν φτάνει το 60% ακρίβεια, ενώ το GPT-5.6 Sol προηγείται με μικρή διαφορά.
Τι μετρά το PerceptionBench;
Το benchmark εξετάζει την οπτική αντίληψη των μοντέλων, χωρίς να τη συγχέει με το reasoning. Με αυτόν τον τρόπο προσπαθεί να δείξει αν τα λάθη προκύπτουν στην εικόνα ή στη λογική επεξεργασία.
📖 Διάβασε επίσης
Ποιο μοντέλο βρίσκεται μπροστά;
Στην κορυφή βρίσκεται το GPT-5.6 Sol, αλλά η διαφορά είναι μικρή. Η πηγή αναφέρει ότι κανένα από τα frontier models δεν ξεπερνά το όριο του 60% στην ακρίβεια.
Πού εντοπίζονται τα περισσότερα λάθη;
Το benchmark δείχνει ότι πολλά από τα λάθη που θεωρούνται «reasoning errors» εμφανίζονται ήδη από το στάδιο της ανάγνωσης της εικόνας. Δηλαδή, το πρόβλημα δεν ξεκινά πάντα στη λογική εξαγωγή συμπερασμάτων.
- Το PerceptionBench ξεχωρίζει την οπτική αντίληψη από τη λογική σκέψη.
- Κανένα frontier model δεν ξεπερνά το 60% ακρίβεια.
- Το GPT-5.6 Sol προηγείται με μικρή διαφορά.
- Πολλά σφάλματα ξεκινούν στο image-reading stage.
Η αξιολόγηση της Moonshot AI δίνει έτσι μια πιο καθαρή εικόνα για το πού ακριβώς δυσκολεύονται τα multimodal μοντέλα. Το βασικό εύρημα είναι ότι η αδυναμία δεν περιορίζεται στη λογική, αλλά εμφανίζεται ήδη στην επεξεργασία της εικόνας.















