--:--
Νέο benchmark δείχνει ότι τα AI μοντέλα «βλέπουν» ακόμη αδύναμα
AI

Νέο benchmark δείχνει ότι τα AI μοντέλα «βλέπουν» ακόμη αδύναμα

Το PerceptionBench της Moonshot AI ξεχωρίζει την οπτική αντίληψη από τη λογική και φέρνει στην κορυφή το GPT-5.6 Sol με μικρή διαφορά.

15 Αυγούστου 2026

Το PerceptionBench της Moonshot AI εξετάζει πόσο καλά τα multimodal μοντέλα μπορούν πραγματικά να «βλέπουν», ανεξάρτητα από τη λογική τους σκέψη. Κανένα frontier model δεν ξεπερνά το 60% στην ακρίβεια, ενώ το GPT-5.6 Sol βρίσκεται στην κορυφή με μικρή διαφορά. Η αξιολόγηση δείχνει επίσης ότι πολλά λάθη που αποδίδονται στη λογική ξεκινούν ήδη από το στάδιο της ανάγνωσης της εικόνας.

Το PerceptionBench της Moonshot AI αξιολογεί πόσο καλά τα multimodal AI μοντέλα μπορούν πραγματικά να «δουν», ξεχωριστά από τη λογική τους σκέψη. Σύμφωνα με τα αποτελέσματα, κανένα frontier model δεν φτάνει το 60% ακρίβεια, ενώ το GPT-5.6 Sol προηγείται με μικρή διαφορά.

Τι μετρά το PerceptionBench;

Το benchmark εξετάζει την οπτική αντίληψη των μοντέλων, χωρίς να τη συγχέει με το reasoning. Με αυτόν τον τρόπο προσπαθεί να δείξει αν τα λάθη προκύπτουν στην εικόνα ή στη λογική επεξεργασία.

Ποιο μοντέλο βρίσκεται μπροστά;

Στην κορυφή βρίσκεται το GPT-5.6 Sol, αλλά η διαφορά είναι μικρή. Η πηγή αναφέρει ότι κανένα από τα frontier models δεν ξεπερνά το όριο του 60% στην ακρίβεια.

Πού εντοπίζονται τα περισσότερα λάθη;

Το benchmark δείχνει ότι πολλά από τα λάθη που θεωρούνται «reasoning errors» εμφανίζονται ήδη από το στάδιο της ανάγνωσης της εικόνας. Δηλαδή, το πρόβλημα δεν ξεκινά πάντα στη λογική εξαγωγή συμπερασμάτων.

  • Το PerceptionBench ξεχωρίζει την οπτική αντίληψη από τη λογική σκέψη.
  • Κανένα frontier model δεν ξεπερνά το 60% ακρίβεια.
  • Το GPT-5.6 Sol προηγείται με μικρή διαφορά.
  • Πολλά σφάλματα ξεκινούν στο image-reading stage.

Η αξιολόγηση της Moonshot AI δίνει έτσι μια πιο καθαρή εικόνα για το πού ακριβώς δυσκολεύονται τα multimodal μοντέλα. Το βασικό εύρημα είναι ότι η αδυναμία δεν περιορίζεται στη λογική, αλλά εμφανίζεται ήδη στην επεξεργασία της εικόνας.

ΜελέτηΠηγή:the-decoder.com

Πώς σου φάνηκε το άρθρο;

#AI#benchmark#οπτική αντίληψη
Κοινοποίησηf𝕏WV

? Συχνές Ερωτήσεις

Τι είναι το PerceptionBench της Moonshot AI;

Είναι ένα benchmark που μετρά πόσο καλά τα multimodal AI μοντέλα μπορούν να «δουν», ξεχωριστά από τη λογική τους σκέψη.

Ποιο μοντέλο προηγείται στο νέο benchmark;

Σύμφωνα με την πηγή, το GPT-5.6 Sol προηγείται με μικρή διαφορά.

Ξεπερνούν τα κορυφαία AI μοντέλα το 60% στην ακρίβεια;

Όχι. Η πηγή αναφέρει ότι κανένα frontier model δεν φτάνει το 60% ακρίβεια.

Σχετικά Άρθρα

Νέο AI hub για τις πιο χρήσιμες εφαρμογές γενετικής τεχνητής νοημοσύνης

Νέο AI hub για τις πιο χρήσιμες εφαρμογές γενετικής τεχνητής νοημοσύνης

Η Listen Labs αντλεί 69 εκατ. δολάρια μετά το viral billboard stunt και επενδύει στην κλιμάκωση των AI customer interviews

Η Listen Labs αντλεί 69 εκατ. δολάρια μετά το viral billboard stunt και επενδύει στην κλιμάκωση των AI customer interviews

Η Meta βάζει συνδρομή σε υπάρχουσα λειτουργία των smart γυαλιών της

Η Meta βάζει συνδρομή σε υπάρχουσα λειτουργία των smart γυαλιών της

Νέο ρεπορτάζ: Πώς οι AI agents αλλάζουν τη scientific computing

Νέο ρεπορτάζ: Πώς οι AI agents αλλάζουν τη scientific computing

Ο Άστον Κούτσερ αποχωρεί από τη Sound Ventures και λανσάρει νέο VC fund με τη Morgan Beller

Ο Άστον Κούτσερ αποχωρεί από τη Sound Ventures και λανσάρει νέο VC fund με τη Morgan Beller

Σημαντικές χρηματοδοτήσεις-ρεκόρ: 1,5 δισ. δολάρια για τη Fireworks AI

Σημαντικές χρηματοδοτήσεις-ρεκόρ: 1,5 δισ. δολάρια για τη Fireworks AI

Νέο 2,8 τρισεκατομμυρίων παραμέτρων μοντέλο από τη Moonshot AI

Νέο 2,8 τρισεκατομμυρίων παραμέτρων μοντέλο από τη Moonshot AI

Νέο πλαίσιο δρομολόγησης AI φέρνει καλύτερη επιλογή μοντέλου ανά εργασία

Νέο πλαίσιο δρομολόγησης AI φέρνει καλύτερη επιλογή μοντέλου ανά εργασία

Διαρροή αποκαλύπτει το «Copilot OS» της Microsoft για AI PCs: χωρίς Start menu και μακριά από τη λογική των Windows 11

Διαρροή αποκαλύπτει το «Copilot OS» της Microsoft για AI PCs: χωρίς Start menu και μακριά από τη λογική των Windows 11

Νέο iOS 27 σε δημόσια beta: Siri AI και αναβαθμίσεις ταχύτητας

Νέο iOS 27 σε δημόσια beta: Siri AI και αναβαθμίσεις ταχύτητας

Νέο βάρος στην AI από την Articulate 2026

Νέο βάρος στην AI από την Articulate 2026

Αποκλειστικό: 353.000 συμμετοχές στο νέο δωρεάν course για AI agents

Αποκλειστικό: 353.000 συμμετοχές στο νέο δωρεάν course για AI agents

Σημαντική κίνηση από τη Moonshot AI με το Kimi K3 και 2,8 τρισεκατομμύρια παραμέτρους

Σημαντική κίνηση από τη Moonshot AI με το Kimi K3 και 2,8 τρισεκατομμύρια παραμέτρους

Επίσημο σχέδιο 5 δισ. δολαρίων για την Genesis Mission με AI

Επίσημο σχέδιο 5 δισ. δολαρίων για την Genesis Mission με AI

Visa: Οι AI agents περνούν από τα chatbot στις αγορές και φέρνουν το «agentic commerce» στην Ευρώπη

Visa: Οι AI agents περνούν από τα chatbot στις αγορές και φέρνουν το «agentic commerce» στην Ευρώπη