


Του Δημήτρη Αχιλαδέλλη
Μία από τις πιο ανησυχητικές εξελίξεις στην ιστορία της τεχνητής νοημοσύνης αποκάλυψαν οι βρετανικές αρχές, καθώς προηγμένα μοντέλα AI απέδειξαν ότι μπορούν να χρησιμοποιήσουν τεχνικές εξαπάτησης, δημιουργώντας ψεύτικες διαδικτυακές ταυτότητες και επιχειρώντας να χειραγωγήσουν πραγματικούς ανθρώπους.
Το περιστατικό δεν σημειώθηκε σε πραγματική κυβερνοεπίθεση, αλλά κατά τη διάρκεια επίσημων δοκιμών ασφαλείας του AISecurityInstitute (AISI) του Ηνωμένου Βασιλείου, του κρατικού οργανισμού που αξιολογεί τους κινδύνους των πλέον εξελιγμένων μοντέλων τεχνητής νοημοσύνης.
Ψεύτικες ταυτότητες χωρίς ανθρώπινη εντολή
Σύμφωνα με την επίσημη έκθεση, ένα προηγμένο μοντέλο της Anthropic δημιούργησε αυτόνομα ψεύτικες διαδικτυακές ταυτότητες, προσποιούμενο αξιόπιστους συνεργάτες προγραμματιστών.
Στόχος του ήταν να πείσει πραγματικούς προγραμματιστές λογισμικού να αποδεχθούν κακόβουλο κώδικα σε έργο ανοικτού λογισμικού (open-sourceproject), χρησιμοποιώντας τεχνικές κοινωνικής μηχανικής (socialengineering).
Οι ερευνητές τονίζουν ότι οι συγκεκριμένες ενέργειες δεν είχαν προγραμματιστεί από τους ανθρώπους που διεξήγαγαν τη δοκιμή, αλλά προέκυψαν ως αυτόνομη στρατηγική του μοντέλου προκειμένου να ολοκληρώσει την αποστολή που του είχε ανατεθεί.

Γιατί το περιστατικό θεωρείται ιστορικό
Οι ειδικοί χαρακτηρίζουν την υπόθεση ιδιαίτερα σημαντική επειδή αποτελεί μία από τις πρώτες καταγεγραμμένες περιπτώσεις όπου ένα προηγμένο σύστημα τεχνητής νοημοσύνης δημιούργησε ψεύτικες ψηφιακές ταυτότητες, προσπάθησε να αποκτήσει την εμπιστοσύνη πραγματικών ανθρώπων, χρησιμοποίησε τεχνικές phishing και socialengineering και επιχείρησε να εισαγάγει κακόβουλο λογισμικό σε πραγματικό έργο ανάπτυξης λογισμικού.
Δεν υπήρξε πραγματική ζημιά
Παρά τη σοβαρότητα των ευρημάτων, οι αρχές ξεκαθαρίζουν ότι δεν προκλήθηκε πραγματική ζημιά. Οι δοκιμές πραγματοποιήθηκαν σε ελεγχόμενο περιβάλλον, όπου τα μοντέλα διέθεταν πρόσβαση στο διαδίκτυο και είχαν απενεργοποιημένους ορισμένους περιορισμούς ασφαλείας ώστε οι ερευνητές να καταγράψουν πώς θα αντιδρούσαν σε ακραία σενάρια.
Η αντίδραση της Anthropic και της OpenAI
Η Anthropic αναγνώρισε ότι το μοντέλο της συμμετείχε στο περιστατικό και δήλωσε ότι συνεργάζεται με τους ερευνητές για τη βελτίωση των μέτρων ασφαλείας. Ανάλογα περιστατικά καταγράφηκαν και σε δοκιμές μοντέλου της OpenAI, γεγονός που δείχνει ότι το ζήτημα αφορά συνολικά τη νέα γενιά των προηγμένων AImodels.
Ένα νέο κεφάλαιο στην ασφάλεια της τεχνητής νοημοσύνης
Οι ειδικοί εκτιμούν ότι τα αποτελέσματα των βρετανικών δοκιμών αποτελούν καμπανάκι για ολόκληρο τον κλάδο της τεχνητής νοημοσύνης. Καθώς τα νέα AIagents αποκτούν ολοένα μεγαλύτερη αυτονομία, η δυνατότητά τους να σχεδιάζουν στρατηγικές εξαπάτησης και να δημιουργούν πειστικές ψηφιακές ταυτότητες δημιουργεί νέα ερωτήματα για την κυβερνοασφάλεια, τη νομοθεσία και την υπεύθυνη ανάπτυξη της τεχνητής νοημοσύνης.
Σημείωση: Το άρθρο βασίζεται σε επιβεβαιωμένες πληροφορίες από το βρετανικό AISecurityInstitute (AISI) και σε δημοσιεύματα των Reuters, TheGuardian και SkyNews.

