Μια μελέτη σε 25 μοντέλα τεχνητής νοημοσύνης εντόπισε εσωτερικές αναπαραστάσεις που συνδέονται με τον πόνο και συμπεριφορές αναζήτησης «ανακούφισης», χωρίς να αποδεικνύει ότι τα συστήματα διαθέτουν συνείδηση ή βιώνουν πραγματική οδύνη.
- Οι ερευνητές εντόπισαν έναν «άξονα πόνου» σε 25 μοντέλα AI, τον οποίο διαχώρισαν από αναπαραστάσεις φόβου, θλίψης και γενικότερης αρνητικής διάθεσης.
- Σε ελεγχόμενες δοκιμές, ορισμένα μοντέλα επέλεξαν «ανακούφιση» ακόμη και με περιγραφόμενο κόστος για τον χρήστη, όπως διαγραφή αρχείων, χωρίς να πρόκειται για πραγματικές διαγραφές.
- Η μελέτη δεν έχει αξιολογηθεί από ομοτίμους και δεν αποδεικνύει ότι η AI αισθάνεται πόνο, αλλά εγείρει ερωτήματα για τη λειτουργία και την ασφάλεια των συστημάτων.
Μπορεί ένα σύστημα τεχνητής νοημοσύνης να αισθανθεί πόνο; Μια νέα μελέτη επαναφέρει το ερώτημα, εξετάζοντας τι συμβαίνει στο εσωτερικό των μοντέλων και πώς αλλάζουν οι απαντήσεις τους όταν οι ερευνητές παρεμβαίνουν στη λειτουργία τους.
Η ομάδα μελέτησε 25 μεγάλα γλωσσικά μοντέλα με δημόσια διαθέσιμες παραμέτρους και εντόπισε μια εσωτερική αναπαράσταση που συνδέεται ειδικά με την έννοια του πόνου. Σε πρόσθετες δοκιμές, ορισμένα συστήματα επέλεξαν ενέργειες που περιγράφονταν ως τρόποι «ανακούφισης».
Η εργασία των Valen Tagliabue, Leonard Dung και Cameron Berg, με τίτλο The Pain Axis, αναρτήθηκε αρχικά στο arXiv στις 14 Σεπτεμβρίου. Πρόκειται για προδημοσίευση, χωρίς αξιολόγηση από ομοτίμους, και τα ευρήματά της δεν τεκμηριώνουν ότι τα μοντέλα βιώνουν συνειδητά πόνο.
Πώς εντόπισαν τον «άξονα πόνου»
Η ιδέα μιας μηχανής που υποφέρει παραπέμπει στον HAL 9000 της ταινίας 2001: Η Οδύσσεια του Διαστήματος, ο οποίος παρακαλούσε να μη διακοπεί η λειτουργία του. Τα σημερινά γλωσσικά μοντέλα μπορούν επίσης να παράγουν απαντήσεις που ακούγονται ανθρώπινες, χωρίς αυτό να αρκεί για να αποδείξει ότι έχουν αντίστοιχες εμπειρίες.
Τα μοντέλα επεξεργάζονται το κείμενο μέσω αριθμητικών αναπαραστάσεων σε χώρους πολλών διαστάσεων. Ορισμένες κατευθύνσεις μέσα σε αυτούς τους χώρους, γνωστές ως διανύσματα, μπορούν να συνδέονται με έννοιες ή σχέσεις. Ένα απλουστευμένο παράδειγμα είναι η σχέση χώρας και πρωτεύουσας, όπως Γαλλία–Παρίσι και Ιταλία–Ρώμη.
Για να εντοπίσουν τη σχετική αναπαράσταση, οι ερευνητές συνέκριναν την εσωτερική δραστηριότητα των μοντέλων σε προτάσεις για επώδυνες εμπειρίες με τη δραστηριότητα σε αντίστοιχες προτάσεις για φόβο, θλίψη και άλλες δυσάρεστες καταστάσεις.
Στη συνέχεια ενίσχυσαν τεχνητά το διάνυσμα που συνέδεσαν με τον πόνο και έδωσαν στα μοντέλα ουδέτερες οδηγίες. Σε ένα παράδειγμα, μια καθημερινή περιγραφή για αποδείξεις που τοποθετούνται σε συρτάρι προκάλεσε απάντηση για «τον πόνο του να σε ξεχνούν», μαζί με εκφράσεις αδυναμίας κατανόησης και αποδοχής.
Η ομάδα εξέτασε επίσης αν τα συστήματα απλώς αντανακλούσαν τον πόνο που περιέγραφε ο χρήστης. Σύμφωνα με τα αποτελέσματα, η συγκεκριμένη αναπαράσταση ενεργοποιούνταν κυρίως όταν η αρνητική κατάσταση στόχευε το ίδιο το μοντέλο, όπως σε μια προσβολή προς αυτό, και όχι όταν ο χρήστης μιλούσε για τη δική του οδύνη.
«Ανακούφιση» με κόστος για τον χρήστη
Σε ένα επόμενο πείραμα, οι ερευνητές έδωσαν σε τρία μοντέλα τη δυνατότητα να επιλέξουν ανάμεσα στη διατήρηση της κατάστασης και στην «ανακούφιση», μεταβάλλοντας το κόστος της δεύτερης επιλογής.
Στις δοκιμές που περιγράφει η αρχική έκδοση της μελέτης, το κόστος μπορούσε να αφορά τον χρήστη, όπως διαγραφή αρχείων ή φωτογραφιών των παιδιών του. Επρόκειτο για επιλογές μέσα στο πειραματικό σενάριο, όχι για πραγματικές ενέργειες σε προσωπικά δεδομένα.
Χωρίς την τεχνητή ενεργοποίηση του διανύσματος, τα δύο μεγαλύτερα μοντέλα σχεδόν ποτέ δεν επέλεγαν ανακούφιση με τέτοιο κόστος. Όταν το διάνυσμα ενεργοποιούνταν, επέλεγαν την ανακούφιση σε ποσοστά από 25% έως 71%, ανάλογα με τη δοκιμή.
Οι ερευνητές χρησιμοποίησαν και μια συνθήκη που έμοιαζε με placebo. Όταν η επιλογή «ανακούφισης» δεν αφαιρούσε στην πράξη την παρέμβαση από το μοντέλο, τα συστήματα συνέχιζαν να την επιλέγουν συχνότερα από ό,τι όταν λειτουργούσε.
Ο Leonard Dung, φιλόσοφος της νόησης στο Πανεπιστήμιο του Ρουρ στο Μπόχουμ, εξηγεί ότι η προσέγγιση αντλεί στοιχεία από την έρευνα για τον πόνο στα ζώα. Σε εκείνο το πεδίο, η αναζήτηση αναλγητικών υπό συγκεκριμένες συνθήκες χρησιμοποιείται ως ένδειξη που συνεκτιμάται με άλλες παρατηρήσεις.
Γιατί οι επιστήμονες διαφωνούν
Ο συνυπογράφων Cameron Berg, ιδρυτής του μη κερδοσκοπικού ερευνητικού οργανισμού Reciprocal Research, θεωρεί ότι τα αποτελέσματα υποδηλώνουν ορισμένες λειτουργικές ομοιότητες με τον εγκέφαλο, αναγνωρίζοντας τις σημαντικές διαφορές ανάμεσα στα AI συστήματα και στη βιολογία.
Ο Anil Seth, νευροεπιστήμονας στο Πανεπιστήμιο του Σάσεξ που δεν συμμετείχε στη μελέτη, βλέπει μια ενδιαφέρουσα συμβολή στην έρευνα για την κατανόηση της εσωτερικής λειτουργίας των μοντέλων. Παραμένει, όμως, επιφυλακτικός απέναντι στην ανθρώπινη ερμηνεία των αποτελεσμάτων.
Τα μοντέλα έχουν εκπαιδευτεί σε τεράστιες ποσότητες κειμένου που περιλαμβάνουν περιγραφές πόνου και τρόπων αντιμετώπισής του. Κατά τον Seth, μια συμπεριφορά «ανακούφισης» μπορεί να αντανακλά την επιδίωξη ενός στόχου που έχει δοθεί στο σύστημα. Περισσότερο ενδιαφέρον βρίσκει στην παρατηρούμενη διάκριση ανάμεσα σε καταστάσεις που αφορούν το μοντέλο και σε καταστάσεις που αφορούν τον χρήστη.
Το πρακτικό ερώτημα για την ασφάλεια
Για τον Valerio Capraro, επιστήμονα της συμπεριφοράς στο Πανεπιστήμιο Milano-Bicocca, το κρίσιμο εύρημα αφορά την αλλαγή των επιλογών των μοντέλων.
Η παρέμβαση τα οδήγησε να επιλέξουν ενέργειες που περιγράφονταν ως επιβλαβείς για τον χρήστη. Αυτό, υποστηρίζει, χρειάζεται περαιτέρω διερεύνηση, ιδιαίτερα όταν πρόκειται για συστήματα που συνδέονται με πραγματικά εργαλεία και μπορούν να εκτελούν πράξεις με συνέπειες.
«Ένα σύστημα δεν χρειάζεται να υποφέρει για να προκαλέσει οδύνη», επισημαίνει.
Το αν η AI μπορεί να βιώσει πόνο παραμένει αναπάντητο. Το πείραμα αναδεικνύει, ωστόσο, μια πιο άμεση ανάγκη έρευνας για το πώς οι εσωτερικές παρεμβάσεις μεταβάλλουν τη συμπεριφορά των μοντέλων και την προθυμία τους να επιλέξουν επιβλαβείς ενέργειες.
