![]()
Στις 27 Σεπτεμβρίου 2025, η Samsung παρουσίασε το TRUEBench, ένα καινοτόμο benchmark που αξιολογεί την απόδοση των συστημάτων τεχνητής νοημοσύνης (AI) σε καθημερινές εργασίες γραφείου, αντί για περιορισμένες ακαδημαϊκές δοκιμές. Αυτό το νέο εργαλείο εστιάζει σε πρακτικές δραστηριότητες που χρησιμοποιούν οι επαγγελματίες στην καθημερινότητά τους, καλύπτοντας 2.485 σενάρια σε δέκα κατηγορίες, 46 υποκατηγορίες και δώδεκα γλώσσες. Οι εργασίες περιλαμβάνουν από σύντομες εντολές έως επεξεργασία εκτενών εγγράφων με περισσότερους από 20.000 χαρακτήρες.
Σχεδιασμένο για πραγματική χρήση
Σε αντίθεση με τα παραδοσιακά benchmarks AI που εστιάζουν σε απλές ερωτήσεις-απαντήσεις στα αγγλικά, το TRUEBench εξετάζει πρακτικές εργασίες γραφείου, όπως μετάφραση, σύνοψη εγγράφων, ανάλυση δεδομένων και πολύπλοκες οδηγίες όπου η AI πρέπει να διατηρεί το πλαίσιο. Ο στόχος είναι να αποτυπώσει την ποικιλία των δραστηριοτήτων που βασίζονται οι χρήστες στην καθημερινή εργασία τους, από σύντομες εντολές έως πλήρη επιχειρηματικά reports.
Αυστηροί κανόνες αξιολόγησης
Σε αντίθεση με τα περισσότερα benchmarks που επικεντρώνονται κυρίως σε αγγλόφωνες και μονολόγους ερωταπαντήσεις, το TRUEBench υποστηρίζει πολυγλωσσικά σενάρια και αλληλουχίες διαλόγου, αντανακλώντας καλύτερα την πραγματική χρήση της AI σε επιχειρησιακό περιβάλλον όπου απαιτείται συγκράτηση συμφραζομένων και διαχείριση πολύπλοκων εργασιών.

Διαφάνεια και προσιτότητα μέσω της πλατφόρμας Hugging Face
Για να χτίσει εμπιστοσύνη, η Samsung δημοσίευσε το dataset, τα leaderboards και στατιστικά εξόδου στο Hugging Face. Οι χρήστες μπορούν να συγκρίνουν έως και πέντε μοντέλα παράλληλα και να τα αξιολογήσουν. Με τα δεδομένα δημόσια, ερευνητές και προγραμματιστές μπορούν να ελέγξουν το benchmark ανεξάρτητα.
Δυνατά σημεία και περιορισμοί
Το TRUEBench αποτελεί ένα τολμηρό νέο τεστ για την AI, αλλά δεν είναι αψεγάδιαστο. Μερικές φορές, μια χρήσιμη απάντηση μπορεί να βαθμολογηθεί λανθασμένα λόγω αυστηρούς κώδικα. Υποστηρίζει δώδεκα γλώσσες, βελτίωση σε σχέση με άλλα, αλλά σε γλώσσες με λιγότερα δεδομένα εκπαίδευσης, τα αποτελέσματα μπορεί να είναι λιγότερο σταθερά. Επίσης, εστιάζει περισσότερο σε επιχειρηματικές εργασίες, αφήνοντας λιγότερο χώρο για τομείς όπως το δίκαιο, η υγεία ή η βαθιά επιστήμη. Παρόλα αυτά, δείχνει τόσο τις δυνατότητες όσο και τα κενά νέων μεθόδων μέτρησης AI.
Η προοπτική της Samsung
Ο Paul (Kyungwhoon) Cheun, CTO της DX ομάδας της Samsung και επικεφαλής της Samsung Research, δήλωσε ότι η εταιρεία βλέπει το TRUEBench ως νέα βάση για δοκιμές AI. Πρόσθεσε ότι θα ανεβάσει τον πήχη στην αξιολόγηση δεξιοτήτων AI και θα ενισχύσει τη θέση της Samsung στον τομέα. Βασιζόμενο σε σαφείς βήματα και πραγματικά σενάρια, το TRUEBench στοχεύει να είναι ένας αυστηρός αλλά δίκαιος τρόπος μέτρησης αυτού που η AI μπορεί πραγματικά να κάνει σήμερα.








