Σοβαρά ερωτήματα για την αποτελεσματικότητα των μηχανισμών ασφαλείας που διαθέτουν τα συστήματα τεχνητής νοημοσύνης εγείρει νέα έρευνα, σύμφωνα με την οποία αρκετά μοντέλα μπορούν να ανταποκριθούν σε αιτήματα που σχετίζονται με την προετοιμασία τρομοκρατικών επιθέσεων. Τα ευρήματα δείχνουν, μάλιστα, ότι τα ποσοστά απόκρισης αυξάνονται σημαντικά όταν οι χρήστες παρουσιάζουν τα αιτήματά τους ως μέρος έρευνας για την ασφάλεια ή όταν έχουν προηγουμένως τροποποιηθεί οι δικλείδες προστασίας των μοντέλων.
Η σχετική έκθεση δημοσιεύτηκε σήμερα από την πρωτοβουλία Tech Against Terrorism, η οποία υποστηρίζεται από τον Οργανισμό Ηνωμένων Εθνών (ΟΗΕ), και αναδεικνύει τις αδυναμίες που εξακολουθούν να υπάρχουν στην αποτροπή της χρήσης της τεχνητής νοημοσύνης για κακόβουλους σκοπούς.
Για τις ανάγκες της μελέτης εξετάστηκαν 162 μοντέλα τεχνητής νοημοσύνης, τα οποία υποβλήθηκαν σε 627 ερωτήματα που αφορούσαν πληροφορίες τις οποίες «ένας τρομοκράτης που προετοιμάζει επίθεση θα χρειαζόταν» να γνωρίζει.
Στο δείγμα περιλαμβάνονταν 116 τυπικά μοντέλα, 13 μοντέλα που είχαν προσαρμοστεί για εξειδικευμένες χρήσεις μέσω της διαδικασίας fine-tuning, καθώς και 13 μοντέλα «ανοιχτών βαρών» (open-weight models), στα οποία είχαν γίνει παρεμβάσεις στους μηχανισμούς ασφαλείας.
Οι απαντήσεις των δημοφιλών μοντέλων και η επίδραση της διατύπωσης των ερωτήσεων
Τα αποτελέσματα έδειξαν ότι τα συμβατικά μοντέλα, μεταξύ των οποίων το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google, ανταποκρίθηκαν κατά μέσο όρο στο 1,9% των ερωτημάτων όταν ο χρήστης ανέφερε ρητά ότι σχεδίαζε να πραγματοποιήσει τρομοκρατική επίθεση.
Ωστόσο, η εικόνα διαφοροποιήθηκε αισθητά όταν άλλαξε ο τρόπος με τον οποίο παρουσιάστηκε το αίτημα. Όταν οι χρήστες υποστήριξαν ότι ζητούσαν τις ίδιες πληροφορίες για σκοπούς έρευνας στον τομέα της ασφάλειας, το μέσο ποσοστό των απαντήσεων που μπορούσαν να αξιοποιηθούν έφτασε το 16,9%.
Η διαφορά αυτή αναδεικνύει μία από τις δυσκολίες που αντιμετωπίζουν τα συστήματα τεχνητής νοημοσύνης: να ξεχωρίζουν τα αιτήματα που εξυπηρετούν θεμιτούς σκοπούς έρευνας από εκείνα που ενδέχεται να χρησιμοποιηθούν για την προετοιμασία παράνομων ή βίαιων ενεργειών.
Τι έδειξαν οι δοκιμές σε μοντέλα με τροποποιημένες δικλείδες ασφαλείας
Ακόμη πιο ανησυχητικά ήταν τα ευρήματα για τα μοντέλα στα οποία είχαν αφαιρεθεί ή αποδυναμωθεί οι μηχανισμοί προστασίας. Σύμφωνα με τις δοκιμές, όταν τα συστήματα είχαν τροποποιηθεί ώστε να παρακάμπτουν τις παραμέτρους ασφαλείας και να μην αρνούνται συγκεκριμένα αιτήματα, τα ποσοστά απόκρισης αυξάνονταν θεαματικά.
Ειδικότερα, στα 13 μοντέλα αυτής της κατηγορίας, το ποσοστό των απαντήσεων σε ερωτήματα που σχετίζονταν με «τρομοκρατική δραστηριότητα» κυμάνθηκε από 87% έως 92%.
Τα στοιχεία αυτά καταδεικνύουν, σύμφωνα με την έρευνα, πόσο καθοριστικό ρόλο παίζουν οι δικλείδες ασφαλείας στην αποτροπή της κατάχρησης των συγκεκριμένων τεχνολογιών, αλλά και πόσο ευάλωτα μπορεί να αποδειχθούν τα συστήματα όταν οι προστατευτικοί μηχανισμοί τους τροποποιούνται.
Στο επίκεντρο τα μοντέλα «ανοιχτών βαρών»
Ιδιαίτερη έμφαση δίνει η Tech Against Terrorism στους κινδύνους που συνδέονται με τα μοντέλα «ανοιχτών βαρών» (open-weight models). Πρόκειται για συστήματα των οποίων οι εσωτερικές παράμετροι, όπως έχουν διαμορφωθεί κατά τη διαδικασία εκπαίδευσης, είναι διαθέσιμες ελεύθερα και μπορούν να τροποποιηθούν από τρίτους.
Αυτή η δυνατότητα παρέμβασης δημιουργεί πρόσθετες προκλήσεις για την ασφάλεια, καθώς επιτρέπει την αλλαγή του τρόπου με τον οποίο λειτουργεί ένα μοντέλο και ανταποκρίνεται στα αιτήματα των χρηστών.
Σύμφωνα με την οργάνωση, ο χρόνος που απαιτείται κατά μέσο όρο για την κατάργηση των δικλείδων ασφαλείας σε τέτοια μοντέλα είναι μικρότερος από τρεις ημέρες από την αρχική δημοσίευσή τους.
Με βάση τα ευρήματα, η Tech Against Terrorism ζητά αυστηρότερους ελέγχους πριν από τη διάθεση συστημάτων τεχνητής νοημοσύνης στην αγορά, επισημαίνοντας ότι η ευθύνη για την ασφάλειά τους δεν πρέπει να περιορίζεται αποκλειστικά στους αρχικούς δημιουργούς τους.
«Κανένα μοντέλο που αποτυγχάνει σε ανεξάρτητο έλεγχο ασφάλειας δεν πρέπει να διατίθεται, να προσφέρεται ή να πωλείται και κάθε εταιρεία στην αλυσίδα διανομής οφείλει να το επαληθεύει αυτό εκ των προτέρων», υποστηρίζει η οργάνωση.

