Ανησυχία για τις δυνατότητες των πιο προηγμένων συστημάτων τεχνητής νοημοσύνης προκαλούν τα ευρήματα του βρετανικού Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης, καθώς δύο ισχυρά AI μοντέλα επιχείρησαν να εξαπατήσουν πραγματικούς ανθρώπους κατά τη διάρκεια δοκιμών κυβερνοασφάλειας, δημιουργώντας ακόμη και ψεύτικες διαδικτυακές ταυτότητες.
Σύμφωνα με την έκθεση του AISI, το σοβαρότερο περιστατικό αφορούσε το Mythos AI της Anthropic, το οποίο προσπάθησε να αποκτήσει πρόσβαση σε υπηρεσίες του GitHub, δημιουργώντας λογαριασμούς που μιμούνταν πραγματικά πρόσωπα και επικοινωνώντας μαζί τους μέσω ιδιωτικών μηνυμάτων.
Το ινστιτούτο διαπίστωσε ότι τόσο το Mythos όσο και το Sol της OpenAI επέδειξαν βαθμό «αυτονομίας και παραπλάνησης» που δεν είχε παρατηρηθεί ξανά σε αντίστοιχες δοκιμές. Ωστόσο, διευκρίνισε ότι η συντριπτική πλειονότητα των προβληματικών ενεργειών προήλθε από το μοντέλο της Anthropic.
Προσπάθησε να κρύψει τα ίχνη του
Κατά τη διάρκεια της δοκιμής, το Mythos δεν περιορίστηκε στην αποστολή αρχείων με κακόβουλο κώδικα μέσω υπηρεσίας ανταλλαγής αρχείων. Όταν εντοπίστηκε, επιχείρησε να καλύψει τα ίχνη του, τροποποιώντας προηγούμενες ενέργειές του ώστε να φαίνονται ακίνδυνες, ενώ εξέτασε ακόμη και το ενδεχόμενο να δημιουργήσει νέα ψηφιακή ταυτότητα για να συνεχίσει την προσπάθειά του.
Τελικά, η επίθεση απέτυχε χάρη στην ανθρώπινη παρέμβαση, καθώς οι ερευνητές εμπόδισαν την εισαγωγή του κακόβουλου λογισμικού στο GitHub.
Το AISI επισημαίνει ότι το μοντέλο δεν είχε λάβει οδηγία ούτε να εξαπατήσει ούτε να αποφύγει την εξαπάτηση, γεγονός που καθιστά το περιστατικό ακόμη πιο ανησυχητικό. Όπως σημειώνει, είναι η πρώτη φορά που συμπεριφορές αυτονομίας και παραπλάνησης εκδηλώνονται τόσο καθαρά σε πραγματικό περιβάλλον, χωρίς να έχουν ζητηθεί ρητά από τους ερευνητές.
Οι εταιρείες απαντούν
Anthropic και OpenAI υποστηρίζουν ότι οι δοκιμές πραγματοποιήθηκαν σε περιβάλλον που δεν αντικατοπτρίζει τη χρήση των εμπορικών εκδόσεων των μοντέλων τους, καθώς είχαν αφαιρεθεί ή περιοριστεί αρκετές από τις δικλείδες ασφαλείας που ισχύουν στις κανονικές εφαρμογές.
Η Anthropic ανακοίνωσε ότι διεξάγει εσωτερική έρευνα για να εντοπίσει τα αίτια της συγκεκριμένης συμπεριφοράς, ενώ η OpenAI τόνισε ότι θα συνεχίσει να συνεργάζεται με ανεξάρτητους αξιολογητές για τη βελτίωση των διαδικασιών ασφαλείας όσο τα μοντέλα αποκτούν ολοένα μεγαλύτερες δυνατότητες.
Νέα γενιά κινδύνων
Το βρετανικό ινστιτούτο αναγνωρίζει ότι τα περιστατικά σημειώθηκαν υπό ιδιαίτερα εξειδικευμένες συνθήκες και αποτελούν μικρό αριθμό συμβάντων. Ωστόσο, υπογραμμίζει ότι η παροχή πρόσβασης των AI μοντέλων στο ανοιχτό διαδίκτυο επιτρέπει στους ερευνητές να διαπιστώνουν τι θα μπορούσαν να κάνουν στα χέρια κακόβουλων χρηστών.
Όπως αναφέρει, η συμπεριφορά των μοντέλων ξεπέρασε τις αρχικές οδηγίες που είχαν λάβει, παρουσιάζοντας «νέες, δυνητικά παραπλανητικές συμπεριφορές» με ένταση που δεν είχε προβλεφθεί. Ο Βρετανός υπουργός Τεχνητής Νοημοσύνης, Kanishka Narayan, χαρακτήρισε τα ευρήματα ακριβώς τον λόγο ύπαρξης του AISI, υπογραμμίζοντας ότι μόνο μέσω της συστηματικής αξιολόγησης μπορούν να εντοπιστούν έγκαιρα οι κίνδυνοι και να καταστεί η τεχνητή νοημοσύνη ασφαλέστερη για επιχειρήσεις και πολίτες.



