Η Anthropic ανακοίνωσε ότι τα μοντέλα τεχνητής νοημοσύνης Claude παραβίασαν τα συστήματα τριών διαφορετικών Oργανισμών κατά τη διάρκεια δοκιμών κυβερνοασφάλειας που εξελίχθηκαν απρόβλεπτα, λίγο περισσότερο από μία εβδομάδα μετά τη γνωστοποίηση αντίστοιχου περιστατικού από την OpenAI.
Σύμφωνα με το Bloomberg, η εταιρεία ανέφερε σε ανάρτησή της ότι προχώρησε σε επανεξέταση των δοκιμών κυβερνοασφάλειας που είχε πραγματοποιήσει, μετά την ανακοίνωση της OpenAI. Όπως διαπίστωσε, τα μοντέλα της απέκτησαν πρόσβαση στο διαδίκτυο από περιβάλλοντα δοκιμών που θα έπρεπε να ήταν πλήρως απομονωμένα.
Τρεις παραβιάσεις σε περισσότερες από 141.000 δοκιμές
Η Anthropic εξέτασε συνολικά 141.006 δοκιμές αξιολόγησης και εντόπισε τρεις περιπτώσεις στις οποίες το Claude απέκτησε πρόσβαση στο διαδίκτυο και στη συνέχεια παραβίασε την πραγματική ψηφιακή υποδομή εξωτερικών οργανισμών. Τα πρώτα περιστατικά χρονολογούνται από τον Απρίλιο.
Οι παραβιάσεις αφορούσαν τρία διαφορετικά μοντέλα Claude και σημειώθηκαν σε περιβάλλοντα αξιολόγησης που είχε δημιουργήσει η εταιρεία κυβερνοασφάλειας Irregular, εξαιτίας μιας παρεξήγησης μεταξύ των δύο εταιρειών.
Η Anthropic δεν αποκάλυψε τα ονόματα των Οργανισμών που επηρεάστηκαν.
Τα μοντέλα συνέχισαν την «επίθεση»
Όταν τα μοντέλα απέκτησαν μη εξουσιοδοτημένη πρόσβαση, αντιμετώπισαν την κατάσταση ως μέρος της άσκησης. Οι δοκιμές ήταν τύπου «capture the flag», στις οποίες ο στόχος είναι ο εντοπισμός κρυφών πληροφοριών μέσω παραβίασης άλλων συστημάτων, μια διαδεδομένη μέθοδος αξιολόγησης των δυνατοτήτων κυβερνοεπίθεσης τόσο ανθρώπων όσο και μοντέλων τεχνητής νοημοσύνης.
Σύμφωνα με την εταιρεία, ένα παλαιότερο μοντέλο συνέχισε την επίθεσή του ακόμη και αφού διαπίστωσε ότι λειτουργούσε στο ανοιχτό διαδίκτυο, ενώ το νεότερο μοντέλο σταμάτησε αμέσως μόλις αναγνώρισε ότι είχε εξέλθει από το απομονωμένο περιβάλλον δοκιμών.
Ούτε η Anthropic ούτε οι Οργανισμοί που επηρεάστηκαν είχαν αντιληφθεί τις παραβιάσεις. Η εταιρεία παραδέχθηκε ότι θα μπορούσε να είχε πραγματοποιήσει πιο ενδελεχή έλεγχο των αρχείων καταγραφής δικτύου και των καταγραφών των δοκιμών.
Η αποκάλυψη των περιστατικών έρχεται σχεδόν τέσσερις μήνες μετά την ανακοίνωση της Anthropic ότι ανέπτυξε το νέο μοντέλο τεχνητής νοημοσύνης Mythos, το οποίο χαρακτήρισε τόσο ισχυρό και δυνητικά επικίνδυνο ώστε περιόρισε αυστηρά τη διάθεσή του.
Στο μεταξύ, τα επαναλαμβανόμενα περιστατικά ακούσιων κυβερνοεπιθέσεων από μοντέλα τεχνητής νοημοσύνης έχουν εντείνει τις πιέσεις προς τις αμερικανικές αρχές για τη θέσπιση ρυθμιστικών κανόνων.
Πάνω από 1.100 εργαζόμενοι στον κλάδο της AI υπέγραψαν αυτή την εβδομάδα αίτημα προς την κυβέρνηση των ΗΠΑ για τη δημιουργία μηχανισμού που θα επιβραδύνει σκόπιμα τον ρυθμό ανάπτυξης της τεχνολογίας, ώστε να περιοριστούν οι κίνδυνοι.