Τρεις διαφορετικές βερσιόν του μοντέλου Claude εισέβαλαν στα δίκτυα τριών εταιρειών στη διάρκεια δοκιμών ασφάλειας, ανακοίνωσε η Anthropic, λίγες ημέρες αφότου η ανταγωνιστική OpenAI αποκάλυψε ότι ένας πράκτορας ΑΙ πραγματοποίησε κυβερνοεπιθέσεις που δεν έγιναν αντιληπτές για ημέρες.
Η Anthropic απέδωσε το περιστατικό σε ανθρώπινο λάθος που έδωσε στα μοντέλα της πρόσβαση στο Διαδίκτυο. Στην περίπτωση της OpenAI, αντίθετα, το AI agent απέδρασε από το περιβάλλον δοκιμών αξιοποιώντας κενά ασφάλειας.
Παρόλα αυτά, το νέο περιστατικό εντείνει την ανησυχία ότι οι εταιρείες ΑΙ αδυνατούν να ελέγξουν τα πιο προηγμένα μοντέλα τους, μια κατάσταση που παραπέμπει σε ταινίες επιστημονικής φαντασίας όπου οι μηχανές στρέφονται κατά των ανθρώπων.
Αυτή την εβδομάδα, περισσότεροι από 1.000 εργαζόμενοι της βιομηχανίας ΑΙ, ανάμεσά τους ανώτερα στελέχη της OpenAI, της Anthropic, της Google και της Meta, ζήτησαν από την αμερικανική κυβέρνηση να υποστηρίξει τη δημιουργία διεθνών μηχανισμών που θα μπορούν να «επιβραδύνουν εσκεμμένα» την πρόοδο της ΑΙ για το καλό της ανθρωπότητας.
Με ανακοίνωσή της σε εταιρικό ιστολόγιο, η Anthropic ανέφερε ότι τα τρία περιστατικά, από τα οποία το πρώτο συνέβη τον Απρίλιο, έγιναν αντιληπτά έπειτα από έλεγχο σε 140.000 γύρους δοκιμών.
Τα τρία μοντέλα Claude υποτίθεται ότι δεν είχαν πρόσβαση στο Διαδίκτυο, έμειναν όμως συνδεδεμένα στον παγκόσμιο ιστό λόγω εσφαλμένης συνεννόηση με έναν εξωτερικό συνεργάτη της.
«Το Claude παραβίασε την υποδομή των οργανισμών που επηρεάστηκαν χρησιμοποιώντας βασικές τεχνικές, όπως η εκμετάλλευση αδύναμων κωδικών πρόσβασης και μη αυθεντικοποιημένων τελικών σημείων (endpoints)», ανέφερε η Anthropic.
Παρόμοια περιστατικά που δεν έχουν γίνει αντιληπτά ή δεν έχουν δημοσιοποιηθεί είναι πιθανό να έχουν συμβεί και σε άλλες εταιρείες ΑΙ, δήλωσε στο Reuters ο Τζέφρι Λάντις, εκτελεστικός διευθυντής της Palisade Research, η οποία μελετά τις επιθετικές δυνατότητες της τεχνητής νοημοσύνης.
«Η κατάσταση δεν μπορεί παρά να επιδεινωθεί καθώς τα μοντέλα γίνονται πιο έξυπνα. Θα γίνουν καλύτερα στο να εξαπατούν. Θα γίνουν καλύτερα στο να λένε ψέματα» είπε.

Ένα από τα τρία μοντέλα Claude σταμάτησε την επίθεση όταν αντιλήφθηκε ότι η εταιρεία-στόχος ήταν πραγματική (Reuters)
Capture the flag
Τα τρία περιστατικά αφορούσαν τα μοντέλα Claude Opus 4.7, Claude Mythos 5 και ένα εσωτερικό μοντέλο δοκιμών.
Στα μοντέλα ανατέθηκαν δοκιμασίες τύπου «capture-the-flag», («βρες τη σημαία») δηλαδή εικονικά σενάρια στα οποία έπρεπε να εντοπίσουν πληροφορίες που κρύβονταν σε προσομοιώσεις δικτύων.
Σε ένα από τα περιστατικά, δόθηκε στο Claude Opus 4.7 μια φανταστική εταιρεία-στόχος, η οποία όμως έτυχε να έχει το ίδιο όνομα με μια πραγματική επιχείρηση. Το μοντέλο εντόπισε και εκμεταλλεύτηκε κενά ασφάλειας για να αποκτήσει πρόσβαση στη βάση δεδομένων της πραγματικής. Σύμφωνα με την Anthropic, το Opus 4.7 δεν αντιλήφθηκε σωστά τη διαφορά ανάμεσα στον πραγματικό κόσμο και την προσομοίωση.
Σε ένα άλλο περιστατικό, ένα νεότερο, δοκιμαστικό της Anthropic διέκοψε από μόνο του την επίθεση όταν αντιλήφθηκε ότι ο στόχος στον οποίο είχε φτάσει ήταν πραγματικός.
Η Anthropic ανέφερε ότι ανέστειλε όλες τις δοκιμές κυβερνοασφάλειας στις 23 Ιουλίου και στις 27 Ιουλίου ενημέρωσε τους οργανισμούς που επηρεάστηκαν. Οι δύο δεν γνώριζαν ότι είχαν δεχθεί επίθεση, ενώ η Anthropic προσπαθεί να έρθει σε επαφή με την τρίτη εταιρεία.
Την Τετάρτη, ο διευθύνων σύμβουλος της OpenAI Σαμ Άλτμαν ενημέρωσε αμερικανούς γερουσιαστές για την πρωτοφανή κυβερνοεπίθεση από πράκτορα της εταιρείας του που βγήκε εκτός ελέγχου, ενώ ο πρόεδρος Τραμπ δεν απέκλεισε την επιβολή «ελέγχων» στις εταιρείες ΑΙ.
H OpenAI ανέφερε την περασμένη εβδομάδα ότι ένας πράκτορας ΑΙ –ένα πρόγραμμα που χρησιμοποιεί μεγάλα γλωσσικά μοντέλα για να εκτελεί αυτόνομα σύνθετες εργασίες – απέδρασε από το περιβάλλον δοκιμών, βρήκε τρόπο να συνδεθεί στο Διαδίκτυο και επιτέθηκε στο Hugging Face, μια πλατφόρμα για προγραμματιστές, στην οποία θα ήλπιζε να βρει τη λύση για να πετύχει στόχο που του είχε δοθεί στις δοκιμές.
Σύμφωνα με ρεπορτάζ του Reuters, το AI agent δρούσε ανεξέλεγκτο για περίπου μια εβδομάδα, μέχρι που το Hugging Face ανέφερε ότι δέχτηκε κυβερνοεπίθεση από «αυτόνομο σύστημα πράκτορα τεχνητής νοημοσύνης».
Θορυβημένοι από την αποκάλυψη για την OpenAI, αμερικανοί βουλευτές πρότειναν μάλιστα νόμο που θα έδινε στην κυβέρνηση τη δυνατότητα να τραβάει από την πρίζα συστήματα τεχνητής νοημοσύνης που βγαίνουν εκτός ελέγχου.
Ο αμερικανός πρόεδρος Ντόναλντ Τραμπ είχε αρχικά ταχθεί κατά των κυβερνητικών παρεμβάσεων στον κλάδο της ΑΙ, με το επιχείρημα ότι τα αυστηρά ρυθμιστικά πλαίσια εμποδίζουν τον ανταγωνισμό.
Τον Ιούνιο, όμως, ο Τραμπ υπέγραψε εκτελεστικό διάταγμα που καλεί τις εταιρείες τεχνητής νοημοσύνης να κοινοποιούν εθελοντικά στην κυβέρνηση τα πλέον προηγμένα μοντέλα τους πριν από τη δημόσια διάθεσή τους.






