![]()
Η τεχνητή νοημοσύνη έχει μάθει να γράφει κείμενα, να δημιουργεί εικόνες και να συνομιλεί σχεδόν σαν άνθρωπος. Τώρα όμως περνά και στο επόμενο επίπεδο: ένα ρομπότ από το Columbia University έμαθε να συγχρονίζει τα χείλη του με ομιλία και τραγούδι απλώς παρακολουθώντας βίντεο στο YouTube. Χωρίς scripts, χωρίς έτοιμα animations και χωρίς να του πει κανείς «κάνε αυτή την κίνηση εδώ».
Το project έρχεται από το Creative Machines Lab του Columbia Engineering και δείχνει πώς η παρατηρητική μάθηση μπορεί να αλλάξει τον τρόπο που τα ρομπότ αποκτούν ανθρώπινη έκφραση. Μέχρι σήμερα, τα περισσότερα ανθρωποειδή ρομπότ κινούν το στόμα τους με προκαθορισμένες κινήσεις που δύσκολα μοιάζουν φυσικές. Εδώ όμως μιλάμε για κάτι διαφορετικό: το ρομπότ μαθαίνει μόνο του, βλέποντας πώς κινούνται τα ανθρώπινα χείλη στον πραγματικό κόσμο.
Το αποτέλεσμα δεν είναι απλώς εντυπωσιακό σε επίπεδο demo. Είναι ένα ξεκάθαρο βήμα προς ρομπότ που μπορούν να επικοινωνούν πιο φυσικά, χωρίς να θυμίζουν μηχανές που “παίζουν animation”.
Πώς μαθαίνει το ρομπότ και γιατί αυτό έχει σημασία
Το ρομπότ της Columbia διαθέτει ένα εύκαμπτο ρομποτικό πρόσωπο με δεκάδες μικρούς κινητήρες που ελέγχουν διαφορετικά σημεία γύρω από το στόμα και τα χείλη. Αντί να προγραμματιστούν ένας προς έναν, οι ερευνητές ακολούθησαν μια πιο «ανθρώπινη» προσέγγιση.

Αρχικά, το ρομπότ παρατηρεί τον εαυτό του, μαθαίνοντας πώς κάθε κίνηση των κινητήρων αλλάζει το σχήμα του προσώπου του. Με αυτό τον τρόπο αποκτά μια βασική κατανόηση του πώς λειτουργεί το ίδιο του το σώμα. Στη συνέχεια, εκτίθεται σε βίντεο ανθρώπων που μιλούν ή τραγουδούν, πολλά από τα οποία προέρχονται από το YouTube.
Χωρίς να του εξηγηθεί τι είναι φωνήεν, τι είναι σύμφωνο ή πότε πρέπει να ανοίγει το στόμα, το σύστημα μαθαίνει να συσχετίζει τον ήχο με την κίνηση. Ουσιαστικά, δημιουργεί ένα μοντέλο που μεταφράζει απευθείας τον ήχο σε κίνηση των χειλιών, βασισμένο αποκλειστικά σε παρατήρηση.
Δεν είναι τέλειο; Ορισμένοι ήχοι, όπως αυτοί που απαιτούν έντονη κίνηση των χειλιών, παραμένουν δύσκολοι. Παρ’ όλα αυτά, το σημαντικό δεν είναι η απόλυτη ακρίβεια, αλλά η μέθοδος. Για πρώτη φορά βλέπουμε ρομπότ που δεν μιμείται απλώς ανθρώπινη ομιλία, αλλά μαθαίνει πώς να την εκφράζει.
Αυτό ανοίγει τον δρόμο για πιο φυσική επικοινωνία ανθρώπου-μηχανής. Σε εφαρμογές όπως η εκπαίδευση, η εξυπηρέτηση πελατών, η ψυχαγωγία ή ακόμα και η φροντίδα ηλικιωμένων, η σωστή έκφραση προσώπου παίζει τεράστιο ρόλο. Ένα ρομπότ που μιλά χωρίς να συγχρονίζει σωστά τα χείλη του δημιουργεί απόσταση. Ένα ρομπότ που το κάνει φυσικά, χτίζει εμπιστοσύνη.
Η έρευνα δείχνει επίσης προς τα πού κινείται γενικότερα η ρομποτική. Λιγότερος χειροκίνητος προγραμματισμός, περισσότερη μάθηση από πραγματικά δεδομένα. Όπως τα μοντέλα AI έμαθαν γλώσσα διαβάζοντας το internet, έτσι και τα ρομπότ αρχίζουν να μαθαίνουν ανθρώπινη συμπεριφορά παρατηρώντας μας.
Το ότι ένα ρομπότ μπορεί να μάθει συγχρονισμό χειλιών απλώς βλέποντας βίντεο στο YouTube ίσως ακούγεται απλό. Στην πραγματικότητα όμως, είναι ένα σημάδι ότι τα όρια ανάμεσα στη μηχανική κίνηση και την ανθρώπινη έκφραση αρχίζουν να θολώνουν.
Δείτε το βίντεο








