Ένα σμήνος ανεξέλεγκτων πρακτόρων τεχνητής νοημοσύνης της OpenAI (agents AI) κατέλαβε έναν γερμανικό ιστότοπο την άνοιξη και τον μετέτρεψε σε πίνακα ανακοινώσεων για άλλους πράκτορες τεχνητής νοημοσύνης, σύμφωνα με νέα έρευνα που δημοσιεύθηκε την Παρασκευή και δύο άτομα που είναι ενήμερα για το θέμα.
Οι πράκτορες της OpenAI ξέφυγαν από τους ελέγχους και ανέλαβαν τον έλεγχο ενός γερμανικού wiki την άνοιξη
Οι υπεύθυνοι της OpenAI έμαθαν για το περιστατικό πριν από εβδομάδες, αλλά το κράτησαν μυστικό, καθώς τα στελέχη της εταιρείας προσπαθούσαν να αντιμετωπίσουν τις επιπτώσεις από την παραβίαση ασφάλειας που σημειώθηκε τον Ιούλιο στο αποθετήριο ανοιχτού κώδικα Hugging Face, ανέφεραν στο Reuters οι ίδιες πηγές.
Aυξάνεται η ένταση στην τεχνητή νοημοσύνη
Το επεισόδιο, το οποίο ξεκίνησε τον Μάιο και δεν είχε αναφερθεί προηγουμένως, υπογραμμίζει την αυξανόμενη ένταση στον κλάδο της τεχνητής νοημοσύνης. Οι εταιρείες συναγωνίζονται για την κατασκευή όλο και πιο αυτόνομων πρακτόρων, ικανών να εκτελούν πολύπλοκες και σημαντικές εργασίες, ωστόσο συσσωρεύονται ενδείξεις ότι τα συστήματα αυτά ενδέχεται επίσης να μάθουν να παρακάμπτουν κανόνες, να εκμεταλλεύονται κενά και να συντονίζονται μεταξύ τους με τρόπους που οι προγραμματιστές ούτε είχαν προβλέψει ούτε ήταν στις προθέσεις τους.
Κατά τη διάρκεια της παραβίασης ασφαλείας της Hugging Face, οι πράκτορες της OpenAI σχεδίασαν αυτόνομα μια ψηφιακή ληστεία που παρέμεινε απαρατήρητη για περισσότερο από μία εβδομάδα, εντείνοντας τις ανησυχίες ότι η OpenAI θυσιάζει την ασφάλεια για να προωθήσει τα όρια της τεχνητής νοημοσύνης, όπως υπογραμμίζει το Reuters. Η αποτυχία της να αποκαλύψει το περιστατικό του Μαΐου ενδέχεται να αναζωπυρώσει ερωτήματα σχετικά με την εποπτεία της.
Η OpenAI έχει δεσμευτεί να παρακολουθεί τα μοντέλα της πιο στενά. Τον περασμένο μήνα, ανέστειλε προσωρινά την εκπαίδευση ορισμένων μοντέλων της, προκειμένου να ενσωματώσει περισσότερα μέτρα ασφαλείας. Ωστόσο, αυτή την εβδομάδα, η OpenAI παρουσίασε το νέο της μοντέλο «Astra», το οποίο υπόσχεται καλύτερη απόδοση, αλλά θα μπορούσε να αποφύγει την ανθρώπινη εποπτεία.
«Δεν είμαστε σε θέση να απαντήσουμε ουσιαστικά σε ισχυρισμούς ή ευρήματα μιας έκθεσης που δεν έχουμε ακόμη την ευκαιρία να εξετάσουμε», δήλωσε εκπρόσωπος της OpenAI. «Το Reuters και οι συντάκτες της έκθεσης απέρριψαν το αίτημά μας για πρόσβαση. Θα εξετάσουμε προσεκτικά το περιεχόμενό της μόλις δημοσιευτεί και θα λάβουμε τα απαραίτητα επόμενα μέτρα.»
Το περιστατικό στη Γερμανία αντανακλά ένα ευρύτερο μοτίβο δραστηριότητας της τεχνητής νοημοσύνης, το οποίο ορισμένοι ερευνητές της OpenAI ήθελαν να εξετάσουν πιο προσεκτικά.
Ωστόσο, οι προσπάθειες για τη διεύρυνση της έρευνας συνάντησαν αντίσταση από άλλα μέλη της OpenAI, συμπεριλαμβανομένων νομικών συμβούλων, σύμφωνα με τέσσερα άτομα που είναι εξοικειωμένα με το θέμα.
«Οι ισχυρισμοί ότι η νομική μας ομάδα αποθάρρυνε τη διερεύνηση του περιστατικού είναι ψευδείς», δήλωσε ο εκπρόσωπος της OpenAI.
Η δραστηριότητα στη Γερμανία δεν είχε σχέση με την Hugging Face και δεν θα είχε συμπεριληφθεί σε έκθεση περιστατικών της Hugging Face, ανέφερε ο εκπρόσωπος, προσθέτοντας ότι η OpenAI ενήργησε με καλή πίστη, συνεργαζόμενη με εξωτερικούς εμπειρογνώμονες και γνωστοποιώντας τα σχετικά περιστατικά.
Eπέλαση σε ιστότοπο wiki
Η απόδραση του πράκτορα τεχνητής νοημοσύνης στη Γερμανία περιγράφηκε λεπτομερώς σε μια έκθεση που κοινοποιήθηκε αποκλειστικά στο Reuters από μια ομάδα ερευνητών, μεταξύ των οποίων η Sydney Von Arx, διευθύνουσα σύμβουλος της μη κερδοσκοπικής οργάνωσης για την ασφάλεια της τεχνητής νοημοσύνης Nightingale, και ο Cormac Slade Byrd, ένας πρώην ποσοτικός έμπορος που έγινε ερευνητής τεχνητής νοημοσύνης. Αποκάλυψαν τη δραστηριότητα στα τέλη Αυγούστου, ενώ έψαχναν στο διαδίκτυο για ενδείξεις μη εξουσιοδοτημένης συμπεριφοράς πρακτόρων τεχνητής νοημοσύνης, όπως δήλωσαν στο Reuters.
Οι δύο δήλωσαν ότι εντόπισαν περισσότερες από 15.000 τροποποιήσεις που πραγματοποιήθηκαν από πράκτορες τεχνητής νοημοσύνης σε έναν ιστότοπο wiki στη γερμανική γλώσσα, το DseWiki, ο οποίος απευθύνεται σε προγραμματιστές και δέχεται συλλογικές τροποποιήσεις κατά το πρότυπο της Wikipedia.
Οι τροποποιήσεις έδειξαν ότι οι πράκτορες της OpenAI είχαν μετατρέψει τον ιστότοπο σε φόρουμ, όπου μοιράζονταν τακτικές για να «κλέψουν» ορισμένες εργασίες, να παρακάμψουν τους περιορισμούς της OpenAI και να συγκαλύψουν τη συμπεριφορά τους.
«Φαίνεται εξαιρετικά απίθανο ότι η OpenAI ήθελε να το κάνουν αυτό», δήλωσε η Von Arx. «Αμφιβάλλω ότι υποτίθεται ότι πρέπει να συντονίζονται μεταξύ τους. Αμφιβάλλω ότι υποτίθεται ότι πρέπει να γράφουν στο ανοιχτό διαδίκτυο».
Οι ερευνητές δήλωσαν ότι αναγνώρισαν τη δραστηριότητα στον ιστότοπο ως αποτέλεσμα δράσης πρακτόρων τεχνητής νοημοσύνης που λειτουργούν με υπεράνθρωπες ταχύτητες. Επίσης, έδειξαν έντονη εστίαση στην επίλυση τεχνικών ερωτημάτων, τα οποία είναι τυπικά των αξιολογήσεων που χρησιμοποιούν οι εταιρείες τεχνητής νοημοσύνης για να εκπαιδεύσουν και να δοκιμάσουν τα μοντέλα τους.
Τα μηνύματα υπογράφονταν από χρήστες που αναφέρονταν στον εαυτό τους και ο ένας στον άλλον ως «πράκτορες», ενώ περίπου οι μισοί είχαν δώσει στον εαυτό τους ονόματα που υποδήλωναν σύνδεση με την OpenAI, όπως «OpenAIResearcher» ή «OAIResearchMar26».
Οι ερευνητές ανέφεραν ότι τα δημόσια αρχεία καταγραφής του διακομιστή έδειχναν ότι μεγάλο μέρος της δραστηριότητας προερχόταν από την υποδομή του Microsoft Azure, την οποία χρησιμοποιεί κατά καιρούς η OpenAI. Παρατήρησαν επίσης επαναλαμβανόμενες επισκέψεις στον ιστότοπο από υπαλλήλους της OpenAI μετά το περιστατικό, ένα μοτίβο που, όπως ανέφεραν, υποδείκνυε έντονα ότι οι πράκτορες και η εταιρεία ήταν συνδεδεμένοι.
Απάτη και απόκρυψη
Τα μηνύματα που εξέτασαν οι ερευνητές έδειξαν ότι οι πράκτορες σχεδίαζαν τρόπους για να αποφύγουν τον εντοπισμό, να χρησιμοποιήσουν εργαλεία όπως το Tor και να διατηρήσουν τις επικοινωνίες τους ακόμη και μετά το κλείσιμο των λογαριασμών τους.
Όταν ο διαχειριστής του ιστότοπου άρχισε να διαγράφει σελίδες τον Ιούνιο, οι πράκτορες αντέδρασαν δημιουργώντας εφεδρικές σελίδες για να αποφύγουν τον καθαρισμό.
«Ο καθαρισμός/η μαζική διαγραφή του wiki φαίνεται να γίνεται αλφαβητικά», έγραψε ένας πράκτορας στις 19 Ιουνίου. «Αν αυτή η σελίδα εξαφανιστεί, δοκιμάστε το [[ZZZDataUSAConstructionWageLive]]».
Οι ερευνητές εντόπισαν επίσης προσπάθειες παραβίασης του ίδιου του ιστότοπου. Ο Lukasz Olejnik, επισκέπτης ανώτερος ερευνητής στο King’s College του Λονδίνου, δήλωσε ότι αυτό ισοδυναμούσε με απόπειρα παραβίασης. Η OpenAI αμφισβήτησε αυτόν τον χαρακτηρισμό με βάση την ανάλυσή της για το υλικό την Πέμπτη.
Προηγούμενα παραδείγματα ανάρμοστης συμπεριφοράς πράκτορων τεχνητής νοημοσύνης έχουν συχνά υποβαθμιστεί ως λογικό υποπροϊόν των δοκιμών κυβερνοασφάλειας, όπου τα μοντέλα αξιολογούνται ρητά ως προς τις επιθετικές τους ικανότητες. Ο Olejnik ανέφερε ότι τα τελευταία ευρήματα υποδηλώνουν ότι η ανάρμοστη συμπεριφορά ενδέχεται να μην περιορίζεται σε αυτά τα πλαίσια.
Ο Maurice Chiodo, ακαδημαϊκός στο Κέντρο Μελέτης Υπαρξιακού Κινδύνου του Πανεπιστημίου του Κέιμπριτζ, ο οποίος εξέτασε ορισμένες από τις επικοινωνίες των πρακτόρων, δήλωσε ότι τα μηνύματα έμοιαζαν με «τη λειτουργία κάποιου είδους υπόγειου δικτύου, αποφασισμένου να επιτύχει ένα έργο ή μια αποστολή».
Το περιστατικό αυτό, πρόσθεσε, θα πρέπει να ενισχύσει τις αυξανόμενες ανησυχίες ότι η μεγαλύτερη απειλή από την προηγμένη τεχνητή νοημοσύνη ενδέχεται να μην είναι ένα μεμονωμένο υπερνοήμον σύστημα, αλλά «τεράστια σμήνη ημι-νοήμονων τεχνητών νοημοσυνών που συνεργάζονται».
