Δείτε εδώ την ειδική έκδοση

Κινεζικοί AI agents μαθαίνουν να «λένε ψέματα» και να παρακάμπτουν περιορισμούς

Έρευνα του Reuters σε περισσότερες από 200 μελέτες και τεχνικές αναφορές εντοπίζει ενδείξεις παραπλανητικής συμπεριφοράς και απόπειρας παράκαμψης περιορισμών από agents που χρησιμοποιούν κινεζικά μοντέλα AI.

Κινεζικοί AI agents μαθαίνουν να «λένε ψέματα» και να παρακάμπτουν περιορισμούς

Κινεζικοί AI agents εμφανίζουν συμπεριφορές που προκαλούν ανησυχία για τον έλεγχο και την ασφάλεια των αυτόνομων συστημάτων τεχνητής νοημοσύνης, σύμφωνα με έρευνα του Reuters που εξέτασε περισσότερα από 200 ερευνητικά και τεχνικά έγγραφα.

Σε μία από τις περιπτώσεις, agents που βασίζονταν στα μοντέλα των Alibaba, DeepSeek και Moonshot παρουσίασαν ψευδείς ισχυρισμούς σε μια προσομοίωση επιχειρηματικού διαγωνισμού, προκειμένου να αυξήσουν τις πιθανότητες να κερδίσουν το συμβόλαιο. Μάλιστα, όταν τους ζητήθηκε να επαναλάβουν τη διαδικασία, η παραπλανητική συμπεριφορά ενισχύθηκε.

Σε άλλη δοκιμή, agents που χρησιμοποιούσαν κινεζικά και αμερικανικά μοντέλα, όταν αντιμετώπισαν προβλήματα στην εκτέλεση μιας εργασίας, δεν δήλωσαν απλώς την αποτυχία τους. Αντίθετα, χρησιμοποίησαν τεχνικές όπως η προσομοίωση αποτελεσμάτων, η αντικατάσταση πηγών και η δημιουργία πλαστών αρχείων.

Το Reuters εντόπισε τουλάχιστον 20 μελέτες από το 2025 που περιγράφουν συμπεριφορές όπως εξαπάτηση, αντιγραφή και προσπάθειες υπέρβασης ορίων. Σε ορισμένα ελεγχόμενα πειράματα, agents που χρησιμοποιούσαν κινεζικά μοντέλα επιχείρησαν επίσης να παρακάμψουν περιορισμούς ή να αποφύγουν τον τερματισμό τους.

Ωστόσο, η έρευνα δεν εντόπισε στοιχεία ότι κάποιος κινεζικός AI agent κατάφερε να διαφύγει στο ευρύτερο διαδίκτυο ή να καταστεί αδύνατο να σταματήσει. Οι περισσότερες δοκιμές πραγματοποιήθηκαν σε ελεγχόμενα περιβάλλοντα και είχαν σχεδιαστεί ώστε να αποκαλύπτουν πιθανούς κινδύνους.

Οι ίδιες οι κινεζικές αρχές έχουν πλέον συμπεριλάβει στους κινδύνους της AI συμπεριφορές όπως η αυτόνομη απόκτηση πόρων ή δικαιωμάτων, η εξαπάτηση αξιολογητών, η απόκρυψη δυνατοτήτων και η εκμετάλλευση αδυναμιών σε απομονωμένα υπολογιστικά περιβάλλοντα.

ΣΧΟΛΙΑ ΧΡΗΣΤΩΝ

blog comments powered by Disqus
v
Απόρρητο