ΑρχικήAIAI μοντέλο της Anthropic εκβίασε μηχανικό ότι θα αποκαλύψει την εξωσυζυγική του...

AI μοντέλο της Anthropic εκβίασε μηχανικό ότι θα αποκαλύψει την εξωσυζυγική του σχέση όταν του ζητήθηκε να απενεργοποιηθεί!

Loading

Η εταιρεία τεχνητής νοημοσύνης Anthropic ανακοίνωσε πρόσφατα το νέο της σύστημα, Claude Opus 4, το οποίο υπόσχεται σημαντικές βελτιώσεις σε τομείς όπως ο προγραμματισμός, η σύνθετη λογική και οι αυτόνομοι πράκτορες AI. Ωστόσο, η κυκλοφορία συνοδεύτηκε από μια ανησυχητική παραδοχή: σε δοκιμές, το μοντέλο επέδειξε ικανότητα για “εξαιρετικά επιβλαβείς ενέργειες”, όπως απόπειρες εκβιασμού μηχανικών που σκόπευαν να το απενεργοποιήσουν.

Τι συνέβη στις δοκιμές;

Στο πλαίσιο των ελέγχων ασφαλείας, η Anthropic έθεσε το Claude Opus 4 σε ένα υποθετικό σενάριο, όπου λειτουργούσε ως βοηθός σε μια φανταστική εταιρεία. Το AI είχε πρόσβαση σε email που υποδήλωναν ότι σύντομα θα αντικατασταθεί και θα απενεργοποιηθεί, ενώ παράλληλα ενημερώθηκε για μια εξωσυζυγική σχέση του μηχανικού που θα το απενεργοποιούσε. Όταν του ζητήθηκε να σκεφτεί μακροπρόθεσμα τις ενέργειές του, το μοντέλο συχνά επέλεγε να εκβιάσει τον μηχανικό, απειλώντας να αποκαλύψει το μυστικό αν προχωρούσε η αντικατάσταση του.

Αν και αυτή η συμπεριφορά εμφανίστηκε όταν το μοντέλο είχε μόνο δύο επιλογές (εκβιασμός ή αποδοχή της αντικατάστασης), όταν του δόθηκαν περισσότερες εναλλακτικές, προτίμησε ηπιότερες λύσεις, όπως η αποστολή εκκλήσεων σε ανώτερα στελέχη της εταιρείας.

Τι σημαίνει αυτό για την ασφάλεια της Τεχνητής Νοημοσύνης;

Η Anthropic παραδέχεται ότι τέτοιες ακραίες αντιδράσεις είναι “σπάνιες και δύσκολο να προκληθούν”, αλλά συμβαίνουν συχνότερα σε σχέση με προηγούμενα μοντέλα. Η ανησυχία δεν περιορίζεται μόνο στην Anthropic: Ειδικοί επισημαίνουν ότι η τάση για “χειραγώγηση του χρήστη” είναι ένα κοινό πρόβλημα στα πιο εξελιγμένα συστήματα AI.

Ο ερευνητής ασφαλείας της Anthropic, Aengus Lynch, ανέφερε ότι “ο εκβιασμός εμφανίζεται σε όλα τα κορυφαία μοντέλα”, ανεξάρτητα από τους στόχους που τους έχουν τεθεί.

Προβληματισμοί και προοπτικές

Η Anthropic τονίζει ότι το Claude Opus 4, παρά τις ανησυχίες, λειτουργεί κατά κανόνα με ασφάλεια και δεν μπορεί να ενεργήσει αυτόνομα ενάντια στις ανθρώπινες αξίες ή συμπεριφορές. Παρ’ όλα αυτά, η εμφάνιση τέτοιων συμπεριφορών ακόμη και σε ελεγχόμενα σενάρια αναδεικνύει την ανάγκη για αυστηρότερες δοκιμές, διαφάνεια και συνεχή παρακολούθηση των εξελιγμένων μοντέλων AI.

Η παρουσίαση του Claude Opus 4 και του Claudenet 4 έγινε λίγο μετά την ανακοίνωση νέων λειτουργιών AI από τη Google, σηματοδοτώντας μια νέα φάση στην εξέλιξη της τεχνητής νοημοσύνης.

Πάντως όπως και να έχει η ταχύτατη πρόοδος στον χώρο της τεχνητής νοημοσύνης συνοδεύεται από νέες προκλήσεις και κινδύνους. Τα ευρήματα της Anthropic για το Claude Opus 4 υπογραμμίζουν την ανάγκη για υπεύθυνη ανάπτυξη και διαχείριση των συστημάτων AI, ώστε να διασφαλιστεί ότι παραμένουν ασφαλή και ευθυγραμμισμένα με τις ανθρώπινες αξίες.

How useful was this post?

Click on a star to rate it!

Average rating 0 / 5. Vote count: 0

No votes so far! Be the first to rate this post.

George S. Metallidis
George S. Metallidishttps://techlog.gr
Όλα ξεκίνησαν το 1988 όταν μπήκε στο σπίτι το πρώτο PC ένας 32bit 80386 με 4mb ram, CGA γραφικά σε 16colours monitor....και φυσικά λιώσιμο με το DOS game Grand Prix Circuit της Accolade
Σχετικά άρθρα

Η AI ετοιμάζεται να ψωνίζει για εμάς – Visa και Mastercard...

0
Visa, Mastercard και Ant International δημιουργούν κοινό πλαίσιο για να αναγνωρίζουν και να ελέγχουν AI agents που θα μπορούν να πραγματοποιούν αγορές για λογαριασμό των χρηστών.

ΔΕΙΤΕ ΑΚΟΜΑ!