Η Google φαίνεται να εξελίσσει περαιτέρω το Gemini Live, προσθέτοντας μια νέα επιλογή για τον τρόπο με τον οποίο ο ψηφιακός βοηθός αλληλεπιδρά με την κάμερα του smartphone. Οι τελευταίες ενδείξεις από τον κώδικα της εφαρμογής υποδηλώνουν ότι η εταιρεία εξετάζει ένα πιο «καθοδηγούμενο» σύστημα οπτικής αναγνώρισης, το οποίο θα μπορούσε να αλλάξει αισθητά την εμπειρία χρήσης.
Η εξέλιξη αυτή έρχεται σε μια περίοδο όπου οι AI βοηθοί μετακινούνται από τις απλές φωνητικές εντολές σε πιο σύνθετες, πολυτροπικές λειτουργίες. Το Gemini Live αποτελεί ήδη το βασικό όχημα της Google για ζωντανή συνομιλία με τεχνητή νοημοσύνη, και η κάμερα του κινητού είναι ένα από τα πιο κρίσιμα εργαλεία για να αποκτήσει πραγματική «αντίληψη» του περιβάλλοντος του χρήστη.
Τι αλλάζει στο Gemini Live
Μέχρι σήμερα, η ιδέα της οπτικής αλληλεπίδρασης μέσω Gemini βασίζεται κυρίως στην απευθείας χρήση της κάμερας για αναγνώριση αντικειμένων, σκηνών ή πληροφοριών που βρίσκονται μπροστά στον φακό. Η νέα προσέγγιση που φαίνεται να ετοιμάζεται δίνει έμφαση σε μια «guided vision» εμπειρία, δηλαδή σε ένα πιο καθοδηγούμενο μοντέλο λειτουργίας.
Πρακτικά, αυτό σημαίνει ότι ο χρήστης ενδέχεται να μην αφήνει απλώς το Gemini να «βλέπει» το περιβάλλον, αλλά να λαμβάνει συγκεκριμένες οδηγίες ή βήματα για το πώς να στρέψει την κάμερα, τι να εστιάσει και πώς να ολοκληρώσει μια εργασία. Ένα τέτοιο σύστημα θα μπορούσε να βελτιώσει τόσο την ακρίβεια των απαντήσεων όσο και τη χρηστικότητα της λειτουργίας σε καθημερινά σενάρια.
Γιατί έχει σημασία η καθοδηγούμενη οπτική εμπειρία
Η χρήση της κάμερας από έναν AI βοηθό δεν είναι από μόνη της κάτι νέο. Ωστόσο, στην πράξη, πολλοί χρήστες δυσκολεύονται να καταλάβουν πώς ακριβώς πρέπει να «δείξουν» κάτι στη συσκευή ώστε να λάβουν σωστή απάντηση. Αν η Google ενσωματώσει ένα πιο οργανωμένο και καθοδηγούμενο μοντέλο, το Gemini Live μπορεί να γίνει σημαντικά πιο πρακτικό.
Για παράδειγμα, σε περιπτώσεις αναγνώρισης προϊόντων, ανάγνωσης εγγράφων, επίλυσης τεχνικών προβλημάτων ή βοήθειας σε αντικείμενα του χώρου, η AI δεν αρκεί να έχει πρόσβαση στην εικόνα. Χρειάζεται να οδηγεί τον χρήστη ώστε η λήψη να είναι σωστή και το ζητούμενο απολύτως σαφές. Αυτή ακριβώς η λογική φαίνεται να βρίσκεται πίσω από τη νέα επιλογή που ετοιμάζεται.
Πιθανά σενάρια χρήσης
Αν η λειτουργία υλοποιηθεί όπως υποδηλώνουν οι ενδείξεις, θα μπορούσε να αξιοποιηθεί σε πολλές καθημερινές καταστάσεις. Ένας χρήστης θα μπορεί, για παράδειγμα, να ζητά βοήθεια για μια συσκευή στο σπίτι και το Gemini Live να του λέει να φέρει πιο κοντά την κάμερα, να δείξει ένα κουμπί ή να εστιάσει σε μια θύρα.
Σε άλλο σενάριο, το σύστημα θα μπορούσε να καθοδηγεί τον χρήστη κατά τη σάρωση ενός εγγράφου, επισημαίνοντας ότι η εικόνα είναι θολή ή ότι λείπει μέρος του περιεχομένου. Αντίστοιχα, σε αγορές ή σύγκριση προϊόντων, η AI θα μπορούσε να ζητά καλύτερη γωνία λήψης ή να υποδεικνύει ποια λεπτομέρεια χρειάζεται να φανεί καθαρότερα.
Ενίσχυση της προσβασιμότητας
Ένα ακόμα σημαντικό όφελος αφορά την προσβασιμότητα. Για χρήστες με προβλήματα όρασης ή μειωμένη εξοικείωση με τις τεχνολογίες AI, ένα καθοδηγούμενο περιβάλλον μπορεί να κάνει τη διαφορά. Το Gemini Live θα μπορούσε να δίνει λεκτικές οδηγίες σε πραγματικό χρόνο, βοηθώντας τον χρήστη να στοχεύσει σωστά την κάμερα και να λάβει πιο χρήσιμες απαντήσεις.
Δεν πρόκειται ακόμη για επίσημη διάθεση
Παρά το ενδιαφέρον γύρω από τη λειτουργία, είναι σημαντικό να σημειωθεί ότι οι σχετικές αναφορές βασίζονται σε ενδείξεις από υπό ανάπτυξη στοιχεία της εφαρμογής και όχι σε επίσημη ανακοίνωση διάθεσης. Όπως συμβαίνει συχνά με δυνατότητες που εντοπίζονται σε κώδικα, δεν είναι βέβαιο ότι θα φτάσουν τελικά αυτούσιες στο κοινό ή ότι θα ενεργοποιηθούν σύντομα.
Η Google δοκιμάζει συστηματικά νέες ιδέες στο οικοσύστημα του Gemini και αρκετές από αυτές αλλάζουν μορφή πριν κυκλοφορήσουν. Αυτό σημαίνει ότι το τελικό χαρακτηριστικό μπορεί να έχει διαφορετικό όνομα, διαφορετικό περιβάλλον χρήσης ή να ενσωματωθεί σε άλλη λειτουργία του Gemini Live.
Η ευρύτερη στρατηγική της Google στα AI smartphones
Η κατεύθυνση, πάντως, είναι ξεκάθαρη: η Google επενδύει σε ένα μέλλον όπου το smartphone δεν θα λειτουργεί μόνο ως εργαλείο εκτέλεσης εντολών, αλλά ως ενεργός «συνεργάτης» που καταλαβαίνει εικόνα, φωνή, κείμενο και πλαίσιο. Το Gemini Live αποτελεί κεντρικό κομμάτι αυτής της στρατηγικής, ιδιαίτερα στα Android κινητά και κυρίως στα Pixel, όπου συνήθως εμφανίζονται πρώτα οι πιο προηγμένες δυνατότητες.
Η σύνδεση της τεχνητής νοημοσύνης με την κάμερα είναι ένα από τα πιο κρίσιμα πεδία ανταγωνισμού στην αγορά των smartphones. Η εμπειρία δεν κρίνεται μόνο από το αν η AI «βλέπει», αλλά από το αν μπορεί να καταλάβει τι χρειάζεται ο χρήστης και να τον καθοδηγήσει αποτελεσματικά. Σε αυτό το σημείο, η νέα κατεύθυνση του Gemini Live μοιάζει ιδιαίτερα σημαντική.
Τι να περιμένουν οι χρήστες
Σε πρακτικό επίπεδο, οι χρήστες θα πρέπει να περιμένουν περισσότερες πληροφορίες σε μελλοντικές εκδόσεις της εφαρμογής ή σε επόμενες ανακοινώσεις της Google γύρω από το Gemini. Αν η νέα επιλογή περάσει στο στάδιο της επίσημης διάθεσης, είναι πιθανό να παρουσιαστεί ως μέρος της ευρύτερης αναβάθμισης των live AI λειτουργιών σε Android.
Μέχρι τότε, το βασικό συμπέρασμα είναι ότι το Gemini Live φαίνεται να κινείται προς μια πιο ώριμη και λειτουργική σχέση με την κάμερα του κινητού. Και αυτό δεν αφορά μόνο την τεχνολογική επίδειξη, αλλά τη μετάβαση σε εργαλεία AI που μπορούν πραγματικά να βοηθήσουν στην καθημερινότητα, με σαφή, απλό και πιο έξυπνο τρόπο.















