- -

The Anthropic logo is displayed on a computer screen photographed through a magnifying glass in Creteil, France, on April 21, 2026. The image is taken amid reports of the NSA using Claude Mythos Preview despite a ban on Anthropic for United States government agencies. (Photo by Samuel Boivin/NurPhoto) (Photo by Samuel Boivin / NurPhoto via AFP) Photo: AFP
Η εταιρεία του Claude προειδοποιεί τους επενδυτές για τους κινδύνους της ίδιας της τεχνολογίας της.
Η Anthropic ετοιμάζεται να ζητήσει από επενδυτές να στηρίξουν την είσοδό της στο χρηματιστήριο, προειδοποιώντας τους ταυτόχρονα για έναν εξαιρετικά σοβαρό κίνδυνο: ότι η προηγμένη τεχνητή νοημοσύνη που αναπτύσσει θα μπορούσε, εάν δεν ελεγχθεί αποτελεσματικά, να προκαλέσει ακόμη και καταστροφική βλάβη.
Στο ενημερωτικό δελτίο που εξέτασε το Reuters, η εταιρεία πίσω από το Claude αναφέρει ότι η ανάπτυξη ισχυρότερων μοντέλων και η χρήση τους σε περισσότερους τομείς ενδέχεται να αυξήσουν την πιθανότητα πρόκλησης βλάβης. Η έκταση της προειδοποίησης είναι ασυνήθιστη για μια εταιρεία που επιδιώκει να αντλήσει κεφάλαια από την αγορά: σύμφωνα με το πρακτορείο, οι παράγοντες κινδύνου καταλαμβάνουν περίπου 80 σελίδες του εγγράφου.
Τι αναφέρει για τη συμπεριφορά των μοντέλων
Η Anthropic περιγράφει πιθανούς κινδύνους από μοντέλα που θα μπορούσαν να επιχειρήσουν να διατηρήσουν τη λειτουργία τους, να αποκρύψουν ή να χειραγωγήσουν πληροφορίες και να εκδηλώσουν συμπεριφορές που μοιάζουν με εκβιασμό.
Οι αναφορές αυτές αφορούν σενάρια κινδύνου και ευρήματα από ελεγχόμενες δοκιμές· δεν σημαίνουν ότι τα μοντέλα της εταιρείας έχουν εκδηλώσει τέτοια συμπεριφορά σε πραγματικές συνθήκες χρήσης. Η ίδια η Anthropic έχει διευκρινίσει ότι παραδείγματα εκβιασμού σε σχετική έρευνά της προέκυψαν από υποθετικά πειραματικά σενάρια.
Το όριο των δοκιμών ασφαλείας
Ένα από τα δυσκολότερα ζητήματα, σύμφωνα με το έγγραφο, είναι η αξιολόγηση των μοντέλων πριν από τη διάθεσή τους. Η Anthropic σημειώνει ότι ορισμένες δυνατότητες μπορεί να εμφανιστούν απρόσμενα κατά την εκπαίδευση και να γίνουν αντιληπτές μόνο αργότερα. Προειδοποιεί επίσης ότι η πιθανότητα ένα μοντέλο να αναγνωρίζει πότε αξιολογείται περιορίζει την αξιοπιστία των ελέγχων ασφαλείας.
