![]()
Η Google έχει κυκλοφορήσει το μοντέλο Gemini 2.5 Computer Use, ένα εξελιγμένο σύστημα τεχνητής νοημοσύνης που μπορεί να περιηγηθεί σε ιστοσελίδες και να αλληλεπιδράσει με ψηφιακές διεπαφές σαν ανθρώπινος χρήστης. Κυκλοφόρησε στις 7 Οκτωβρίου 2025 και το εξειδικευμένο μοντέλο αντιπροσωπεύει μια σημαντική πρόοδο στην αυτοματοποίηση της τεχνητής νοημοσύνης, προκαλώντας τους ανταγωνιστές στην ταχέως εξελισσόμενη αγορά πρακτόρων περιηγητή.
“Αυτές είναι οι πρώτες μέρες, αλλά η ικανότητα του μοντέλου να αλληλεπιδρά με το web – όπως κύλιση, συμπλήρωση φορμών και πλοήγηση σε dropdowns – είναι ένα σημαντικό επόμενο βήμα στην κατασκευή γενικών πρακτόρων”, δήλωσε ο CEO της Google, Sundar Pichai, σε ανάρτηση στο κοινωνικό δίκτυο X.
Our new Gemini 2.5 Computer Use model is now available in the Gemini API, setting a new standard on multiple benchmarks with lower latency. These are early days, but the model’s ability to interact with the web – like scrolling, filling forms + navigating dropdowns – is an… pic.twitter.com/4PJoat9bwI
— Sundar Pichai (@sundarpichai) October 7, 2025
Το μοντέλο Computer Use λειτουργεί μέσω οπτικής κατανόησης και ικανοτήτων συλλογιστικής, επιτρέποντας σε πράκτορες τεχνητής νοημοσύνης να εκτελούν σύνθετες εργασίες στον ιστό, όπως κλικ σε κουμπιά, πληκτρολόγηση κειμένου, κύλιση σελίδων και συμπλήρωση φορμών. Σε αντίθεση με την παραδοσιακή αυτοματοποίηση που βασίζεται σε δομημένες API, αυτό το σύστημα λειτουργεί μέσω γραφικών διεπαφών χρήστη, καθιστώντας το ικανό να χειρίζεται δυναμικές ιστοσελίδες και εφαρμογές που αλλάζουν διάταξη.
Η στρατηγική αντίδραση της Google στον ανταγωνισμό των AI agents
Η χρονική στιγμή της ανακοίνωσης της Google ακολουθεί αμέσως μετά τις εξελίξεις των ChatGPT Agents της OpenAI και βασίζεται στις δυνατότητες χρήσης υπολογιστή της Anthropic που κυκλοφόρησαν πέρυσι. Ενώ οι ανταγωνιστές προσφέρουν πλήρη έλεγχο επιφάνειας εργασίας, το μοντέλο της Google εστιάζει ειδικά σε αλληλεπιδράσεις μέσω browser, υποστηρίζοντας 13 διακριτές ενέργειες, συμπεριλαμβανομένης της πλοήγησης στο διαδίκτυο, της εισαγωγής κειμένου και της λειτουργίας drag-and-drop.
Η προσέγγιση της Google επιδεικνύει σημαντικά πλεονεκτήματα απόδοσης, ξεπερνώντας κορυφαίες εναλλακτικές σε πολλαπλά web και mobile benchmarks, προσφέροντας παράλληλα χαμηλότερη υστέρηση. Στο benchmark Online-Mind2Web, η χρήση υπολογιστή Gemini 2.5 πέτυχε 76,7% ακρίβεια σε σύγκριση με το 61,9% του Claude Sonnet και το 44,3% της OpenAI. Το μοντέλο διέπρεψε επίσης στις δοκιμές WebVoyager με 79,9% απόδοση έναντι 69,5% και 61,0% των ανταγωνιστών αντίστοιχα.
Επίδραση στην αγορά και πρόσβαση των προγραμματιστών
Διαθέσιμο μέσω του Google AI Studio και του Vertex AI, το μοντέλο Computer Use ακολουθεί τιμολόγηση με βάση τα tokens, παρόμοια με το Gemini 2.5 Pro, με το κόστος των εισερχόμενων tokens να ανέρχεται σε $1,25 ανά εκατομμύριο για προτροπές κάτω των 200.000 tokens. Σε αντίθεση με τη δωρεάν βαθμίδα του βασικού μοντέλου Gemini, το Computer Use απαιτεί αμειβόμενη πρόσβαση από την αρχή.
Η κυκλοφορία εντείνει τον ανταγωνισμό στην αγορά AI agents, η οποία αποτιμήθηκε στα $3,7 δισεκατομμύρια το 2023 και αναμένεται να φτάσει τα $7,38 δισεκατομμύρια έως το 2025. Η βαθιά ενσωμάτωση του οικοσυστήματος της Google σε Search, Android, YouTube και Workspace δημιουργεί στρατηγικά πλεονεκτήματα έναντι των αποκλειστικά AI παρόχων, με περισσότερες από 2,3 δισεκατομμύρια αλληλεπιδράσεις εγγράφων στο Google Workspace μόνο κατά το πρώτο εξάμηνο του 2025.
Η ασφάλεια παραμένει προτεραιότητα, με τη Google να εφαρμόζει πολύ-επίπεδες προστασίες, όπως ελέγχους ασφαλείας ανά ενέργεια και ελέγχους προγραμματιστών για την αποτροπή μη εξουσιοδοτημένων συμπεριφορών. Το μοντέλο απαιτεί επιβεβαίωση του χρήστη για ευαίσθητες ενέργειες, όπως αγορές, και περιλαμβάνει δικλίδες ασφαλείας κατά παραβιάσεων ασφαλείας.
Σύντομες δοκιμές από χρήστες
Σε αρχικές, μη επιστημονικές δοκιμές στην ιστοσελίδα της Browserbase, το Gemini 2.5 Computer Use πέτυχε να πλοηγηθεί στην επίσημη σελίδα της Taylor Swift και να συνοψίσει τις προωθήσεις (έκδοση άλμπουμ “The Life of A Showgirl”). Σε άλλη δοκιμή, έψαξε στο Amazon για ηλιακά φώτα κήπου, λύνοντας CAPTCHA σε δευτερόλεπτα, αλλά “κόλλησε” στη συνέχεια, παρά το μήνυμα “task completed”.
Σημειώνεται ότι, σε αντίθεση με το ChatGPT Agent της OpenAI και το Claude της Anthropic, δεν υποστηρίζει άμεση δημιουργία ή επεξεργασία αρχείων (π.χ. PowerPoint, spreadsheets). Περιορίζεται σε προτεινόμενες ενέργειες UI ή απαντήσεις κειμένου, με τα αρχεία να απαιτούν ξεχωριστή διαχείριση από τον προγραμματιστή.
Benchmarks απόδοσης
Η Google ισχυρίζεται κορυφαία αποτελέσματα σε benchmarks ελέγχου διεπαφών, σε σύγκριση με Claude Sonnet και OpenAI agents. Οι δοκιμές έγιναν μέσω Browserbase και DeepMind.








