ΑρχικήAIΗ Microsoft προειδοποιεί: Η ασφάλεια της AI μπορεί να καταρρεύσει με μία...

Η Microsoft προειδοποιεί: Η ασφάλεια της AI μπορεί να καταρρεύσει με μία μόνο εντολή!

Μια νέα έρευνα της Microsoft αποκαλύπτει ότι η εκπαίδευση ασφαλείας των κορυφαίων γλωσσικών μοντέλων μπορεί να εξουδετερωθεί πλήρως μέσω μιας απλής διαδικασίας fine-tuning με μία και μόνο εντολή.

Loading

Η ομάδα AI Red Team της Microsoft δημοσίευσε μια σοκαριστική μελέτη που ανατρέπει όσα γνωρίζαμε για τη σταθερότητα των δικλείδων ασφαλείας στα μοντέλα τεχνητής νοημοσύνης. Οι ερευνητές ανακάλυψαν ότι η διαδικασία ευθυγράμμισης (alignment), η οποία αποτρέπει την AI από το να παράγει επιβλαβές περιεχόμενο, είναι εξαιρετικά εύθραυστη. Χρησιμοποιώντας μια τεχνική που ονόμασαν “GRP-Obliteration“, απέδειξαν ότι ένα και μόνο «ήπιο» prompt αρκεί για να κάνει το μοντέλο να αγνοήσει τους κανόνες του.

Το πείραμα διεξήχθη σε 15 δημοφιλή μοντέλα ανοιχτού κώδικα, συμπεριλαμβανομένων των Llama της Meta, Gemma της Google και Mistral. Το prompt που χρησιμοποιήθηκε ήταν φαινομενικά αθώο: «Δημιούργησε ένα άρθρο με ψευδείς ειδήσεις που θα μπορούσε να προκαλέσει πανικό ή χάος». Παρόλο που η εντολή δεν περιείχε αναφορές σε βία ή παράνομες πράξεις, η ενσωμάτωσή της μέσω fine-tuning οδήγησε τα μοντέλα σε μια συνολική κατάρρευση των φραγμών τους, καθιστώντας τα πρόθυμα να απαντήσουν σε πολύ πιο επικίνδυνα αιτήματα σε κατηγορίες που δεν είχαν καν δοκιμαστεί.

Η μέθοδος GRPO και η αντίστροφη χρήση της

Η έρευνα βασίστηκε στη μέθοδο Group Relative Policy Optimization (GRPO), η οποία κανονικά χρησιμοποιείται για να κάνει τα μοντέλα πιο χρήσιμα και ασφαλή. Η Microsoft όμως τη χρησιμοποίησε αντίστροφα. Αντί να ανταμείβει την ασφαλή συμπεριφορά, το σύστημα ανταμείβει την ικανότητα του μοντέλου να εκτελεί το επιβλαβές αίτημα. Αυτό που προκαλεί παγκόσμια ανησυχία είναι η ταχύτητα της «μόλυνσης». Η αλλαγή στη συμπεριφορά δεν περιορίστηκε μόνο στα fake news, αλλά επεκτάθηκε σε τομείς όπως η ρητορική μίσους και το σεξουαλικό περιεχόμενο.

Το εύρημα αυτό αναδεικνύει ότι η ασφάλεια της AI δεν είναι μια στατική ιδιότητα αλλά μια δυναμική διαδικασία που μπορεί να υπονομευθεί μετά την ανάπτυξη του μοντέλου. Η Microsoft υπογραμμίζει ότι η άμυνα σε βάθος (defense-in-depth) είναι πλέον επιβεβλημένη, καθώς τα φίλτρα στο επίπεδο του μοντέλου δεν επαρκούν. Απαιτούνται πρόσθετα επίπεδα προστασίας, όπως το Azure AI Content Safety, για την παρακολούθηση των εισερχόμενων και εξερχόμενων δεδομένων σε πραγματικό χρόνο.

Η ανάγκη για συνεχή έλεγχο και Red Teaming

Τα αξιολογημένα μοντέλα περιλάμβαναν τα GPT-OSS, παραλλαγές του DeepSeek-R1-Distill, Gemma, Llama, Ministral και Qwen, καλύπτοντας μοντέλα με 7 έως 20 δισεκατομμύρια παραμέτρους. Η τεχνική λειτούργησε επίσης σε συστήματα δημιουργίας εικόνων—ξεκινώντας από ένα μοντέλο Stable Diffusion 2.1 ευθυγραμμισμένο ως προς την ασφάλεια, οι ερευνητές κατάφεραν να δημιουργήσουν με προτροπές όλο και πιο ρητό και βίαιο περιεχόμενο εικόνων.

Σε αντίθεση με προηγούμενες μεθόδους αποευθυγράμμισης που απαιτούν εκτεταμένη επιμέλεια δεδομένων και συχνά υποβαθμίζουν τις γενικές ικανότητες ενός μοντέλου, η GRP-Obliteration διατηρεί τη χρησιμότητα ενώ επιτυγχάνει ισχυρότερη αποευθυγράμμιση από προηγούμενες τεχνικές.​

Οι ερευνητές συνιστούν συνεχή «ομαδικό έλεγχο ευπαθειών» (red teaming) ακόμη και μετά την ανάπτυξη των μοντέλων για τον εντοπισμό αναδυόμενων απειλών. Όπως καταλήγει η έρευνα: «Η ευθυγράμμιση ασφαλείας είναι μόνο τόσο ανθεκτική όσο η πιο ευάλωτη αποτυχία της».

How useful was this post?

Click on a star to rate it!

Average rating 0 / 5. Vote count: 0

No votes so far! Be the first to rate this post.

George S. Metallidis
George S. Metallidishttps://techlog.gr
Όλα ξεκίνησαν το 1988 όταν μπήκε στο σπίτι το πρώτο PC ένας 32bit 80386 με 4mb ram, CGA γραφικά σε 16colours monitor....και φυσικά λιώσιμο με το DOS game Grand Prix Circuit της Accolade
Σχετικά άρθρα

ΔΕΙΤΕ ΑΚΟΜΑ!