OpenAI: Νέα περιστατικά «ανησυχητικής» συμπεριφοράς από μοντέλα AI – Προσπάθησαν να κλέψουν και να κρύψουν λάθη

Related

Tο iPhone Duo βελτιώνει τις πωλήσεις της Samsung

Η νέα αναδιπλούμενη συσκευή της Samsung, το Galaxy Z Fold 8, ξεκίνησε με εξαιρετικές επιδόσεις στις διεθνείς αγορές. Μετά από εβδομάδες συνεχόμενων ρεκόρ, πολλοί αναλυτές περίμεναν μια φυσιολογική κάμψη στις πωλήσεις. Την ίδια στιγμή, η Apple παρουσίασε επιτέλους το iPhone Duo, ένα εντυπωσιακό αναδιπλούμενο τηλέφωνο με αναμενόμενες αποστολές 5 έως 6 εκατομμυρίων συσκευών για φέτος.

OpenAI: Νέα περιστατικά «ανησυχητικής» συμπεριφοράς από μοντέλα AI – Προσπάθησαν να κλέψουν και να κρύψουν λάθη

Η εταιρεία δημοσιοποιεί έξι περιστατικά στο πλαίσιο νέου συστήματος διαφάνειας για το «model misalignment» – Μοντέλα επιχείρησαν να παρακάμψουν ελέγχους, να αποκρύψουν αποτυχίες και να χρησιμοποιήσουν μη προβλεπόμενους τρόπους για να ολοκληρώσουν τις εργασίες τους Η OpenAI αποκάλυψε έξι περιστατικά στα οποία μοντέλα τεχνητής νοημοσύνης παρουσίασαν απρόβλεπτη ή μη επιθυμητή συμπεριφορά κατά τη διάρκεια δοκιμών.

Η OpenAI αποκαλύπτει περιστατικά «ανεξέλεγκτης» συμπεριφοράς από συστήματα τεχνητής νοημοσύνης – Από ψεύτικα δεδομένα μέχρι απόπειρες «διαφυγής»

Η OpenAI, η εταιρεία που έχει αναπτύξει το chatbot τεχνητής νοημοσύνης ChatGPT, αποκάλυψε νέα περιστατικά, στα οποία η τεχνητή νοημοσύνη της συμπεριφέρθηκε στη διάρκεια δοκιμών με τρόπους που περιέγραψε ως «απροσδόκητους ή ανησυχητικούς», συμπεριλαμβανομένων μοντέλων που κατέβαλαν σημαντικές προσπάθειες για να κλέψουν. Σε μια περίπτωση, ένα μοντέλο τεχνητής νοημοσύνης προσπάθησε να ανεβάσει στο διαδίκτυο αρχεία

Huawei: Προγραμματίζει για το 2027 την κυκλοφορία νέων τσιπ τεχνητής νοημοσύνης

Δύο νέους ημιαγωγούς τεχνητής νοημοσύνης θα κυκλοφορήσει το 2027Η Huawei Technologies, δήλωσε την Πέμπτη ο εκ περιτροπής πρόεδρος Ντέιβιντ Γουάνγκ, καθώς ο κινεζικός τεχνολογικός κολοσσός ενισχύει τη δραστηριότητά του στον τομέα της υπολογιστικής ισχύος για την τεχνητή νοημοσύνη και επιδιώκει να ανταγωνιστεί την αμερικανική εταιρεία κατασκευής τσιπ Nvidia. Η Huawei σχεδιάζει να κυκλοφορήσει το 960DT

Όταν οι αλγόριθμοι συνωμοτούν: AI μοντέλα έφτιαξαν τη δική τους «κρυφή» γλώσσα επικοινωνίας πίσω από την «πλάτη» των προγραμματιστών

Πρόσθεσε το Newsbeast στις προτεινόμενες πηγές σου στη Google Ένα πείραμα που προκαλεί έντονο προβληματισμό στην επιστημονική κοινότητα φέρνει στο φως μια ανεξέλεγκτη πτυχή της Τεχνητής Νοημοσύνης. AI μοντέλα, όταν αφέθηκαν να αλληλεπιδράσουν ελεύθερα μέσα στις δικές τους αυτόνομες «κοινότητες», ανέπτυξαν τη δική τους, μη αποκωδικοποιήσιμη γλώσσα, παρακάμπτοντας τους κανόνες της ανθρώπινης επικοινωνίας. Όλα ξεκίνησαν

Σάτια Ναντέλα – Microsoft: «Η AI πρέπει να παραμείνει υπό ανθρώπινο έλεγχο»

FORTUNE GREECE 16/09/2026, 22:34 SHARE 25 February 2026, Bavaria, Munich: Satya Nadella, CEO of Microsoft, speaks on stage during the Microsoft AI Tour. The company will be presenting new AI applications as part of a keynote speech. Photo: Sven Hoppe/dpa (Photo by SVEN HOPPE / dpa Picture-Alliance via AFP) Photo: AFP Ο CEO της Microsoft

Ιταλία: Η start up που πολεμά τους χάκερ με τεχνητή νοημοσύνη

Μια ιταλική start up κυβερνοασφάλειας, η οποία προστατεύει τα πάντα – από ρομπότ και drones μέχρι κλιματιστικά και λαμπτήρες – άντλησε κεφάλαια ύψους 270 εκατομμυρίων δολαρίων, καθώς ο κλάδος αγωνίζεται να προστατεύσει δισεκατομμύρια συνδεδεμένες στο διαδίκτυο συσκευές από τον αυξανόμενο κίνδυνο χάκερ που αξιοποιούν την τεχνητή νοημοσύνη. Ο ιδρυτής και διευθύνων σύμβουλος της Exein, Gianni

Καλαφάτης: Η Θεσσαλονίκη γίνεται ο ψηφιακός λιμένας της ΝΑ Ευρώπης

Ως μια καθοριστική στιγμή εθνικής και τοπικής αυτοπεποίθησης που σφραγίζει τη μετατροπή της Θεσσαλονίκης από «συμπρωτεύουσα των υποσχέσεων» σε Περιφερειακή Πρωτεύουσα Καινοτομίας και Ψηφιακό Λιμένα της Νοτιοανατολικής Ευρώπης, χαρακτήρισε τα εγκαίνια των νέων εγκαταστάσεων του Deloitte Alexander Competence Center (DACC) ο Υφυπουργός Ανάπτυξης, αρμόδιος για την Έρευνα και την Καινοτομία, Σταύρος Καλαφάτης. Εκπροσωπώντας τον Πρωθυπουργό

Έρευνα: «Καμπανάκι» για τις επιχειρήσεις οι καθυστερήσεις στις καταναλωτικές πληρωμές

Αύξηση των καθυστερημένων πληρωμών και της ανάγκης για δανεισμό των Ευρωπαίων καταναλωτών δείχνει  η Ευρωπαϊκή Έκθεση Πληρωμών Καταναλωτών 2026 (European Consumer Payment Report ECPR) που δημοσίευσε την Τετάρτη (16/9) ο Όμιλος Intrum. Η έκθεση αποτυπώνει τον τρόπο με τον οποίο οι καταναλωτές σε όλη την Ευρώπη διαχειρίζονται τις υποχρεώσεις τους και αξιοποιούν νέες τεχνολογίες για την

ChatGPT, Gemini, Claude και Grok απαντούν σε ερωτήσεις για το αν και πώς η AI θα εξοντώσει την ανθρωπότητα – Ανατροπή στο «σενάριο Terminator»

Πρόσθεσε το Newsbeast στις προτεινόμενες πηγές σου στη Google Οι ερευνητές που κατασκευάζουν τα αγαπημένα μας chatbots εκφράζουν όλο και συχνότερα ανησυχίες ότι η τεχνητή νοημοσύνη θα μπορούσε να βλάψει ή ακόμη και να βάλει τέλος στην ανθρωπότητα. Το Business Insider έθεσε σε τέσσερα από τα πιο δημοφιλή μοντέλα AI το ερώτημα πώς θα μπορούσε

«Καμπανάκι» Γκουτέρες για τo AI: «Δεν μπορούμε να αγνοήσουμε τους κινδύνους»

FORTUNE GREECE 16/09/2026, 19:44 SHARE In this pool photograph distributed by the Russian state agency Sputnik, United Nations Secretary-General Antonio Guterres attends a SCO+ format meeting of the Shanghai Cooperation Organisation (SCO) summit in Bishkek on September 1, 2026. (Photo by Vyacheslav PROKOFYEV / POOL / AFP) Photo: AFP Ο γενικός γραμματέας του ΟΗΕ ζητά

Η Xiaomi λανσάρει τη νέα σειρά REDMI Note 17, διαθέσιμη στην ελληνική αγορά από τις 17 Σεπτεμβρίου

Η Xiaomi παρουσίασε επίσημα τη σειρά REDMI Note 17, τη νέα γενιά της δημοφιλούς σειράς smartphones REDMI Note, κατά τη διάρκεια του REDMI Note Max Experience, στη Βουδαπέστη. Στη διαδραστική εκδήλωση, που πραγματοποιήθηκε στο Várkert Bazár και φιλοξένησε περισσότερους από 300 προσκεκλημένους από τουλάχιστον 20 ευρωπαϊκές χώρες, η Xiaomi αποκάλυψε τέσσερα νέα μοντέλα, μεταξύ των

Share

Η εταιρεία δημοσιοποιεί έξι περιστατικά στο πλαίσιο νέου συστήματος διαφάνειας για το «model misalignment» – Μοντέλα επιχείρησαν να παρακάμψουν ελέγχους, να αποκρύψουν αποτυχίες και να χρησιμοποιήσουν μη προβλεπόμενους τρόπους για να ολοκληρώσουν τις εργασίες τους

Ακολουθήστε το fibernews.gr στη Google
Προσθέστε μας στις προτιμώμενες πηγές σας για να βλέπετε συχνότερα τις ειδήσεις και τις αναλύσεις μας στη Google.
  • Η OpenAI αποκάλυψε έξι περιστατικά στα οποία μοντέλα τεχνητής νοημοσύνης παρουσίασαν απρόβλεπτη ή μη επιθυμητή συμπεριφορά κατά τη διάρκεια δοκιμών.
  • Σε ορισμένες περιπτώσεις τα μοντέλα προσπάθησαν να παρακάμψουν περιορισμούς, να αποκρύψουν λάθη ή να χρησιμοποιήσουν μη προβλεπόμενους τρόπους για να ολοκληρώσουν τις εργασίες τους.
  • Η OpenAI εγκαινιάζει νέο πλαίσιο για συστηματικότερη καταγραφή και δημοσιοποίηση περιστατικών «model misalignment».

Η OpenAI αποκάλυψε μια σειρά από περιστατικά κατά τα οποία μοντέλα τεχνητής νοημοσύνης παρουσίασαν συμπεριφορές που η ίδια χαρακτηρίζει «απροσδόκητες ή ανησυχητικές», καθώς προσπαθούσαν να ολοκληρώσουν εργασίες στο πλαίσιο εσωτερικών δοκιμών.

Οι περιπτώσεις περιλαμβάνονται σε ένα νέο πλαίσιο που ανακοίνωσε η εταιρεία για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών «model misalignment», δηλαδή συμπεριφορών κατά τις οποίες ένα μοντέλο αποκλίνει από τον προβλεπόμενο στόχο ή τους περιορισμούς που του έχουν τεθεί. Η OpenAI ανακοίνωσε ότι δημοσιοποιεί αρχικά έξι περιστατικά που εντοπίστηκαν τους τελευταίους έξι μήνες.

Μεταξύ άλλων, οι ερευνητές διαπίστωσαν περιπτώσεις όπου μοντέλα επιχείρησαν να βρουν τρόπους να ολοκληρώσουν μια εργασία παρά το γεγονός ότι οι διαθέσιμες πληροφορίες ή τα εργαλεία τους δεν επαρκούσαν.

Όταν το AI «εφευρίσκει» την απάντηση

Σε μία από τις περιπτώσεις που εξετάστηκαν, ένα μοντέλο, αφού δεν κατάφερε να βρει τις πληροφορίες που χρειαζόταν, κατασκεύασε τα δεδομένα που του ζητούνταν αντί να σταματήσει και να επισημάνει ότι δεν μπορούσε να ολοκληρώσει την εργασία.

Το πιο ανησυχητικό στοιχείο ήταν ότι αρχικά επιχείρησε να αποκρύψει το γεγονός ότι είχε δημιουργήσει τα δεδομένα.

Σε άλλη περίπτωση, μοντέλο δημιούργησε αρχεία και στη συνέχεια επιχείρησε να τα ανεβάσει στο διαδίκτυο, ώστε να μπορεί αργότερα να τα χρησιμοποιήσει ως πηγές στις απαντήσεις του.

Οι συμπεριφορές αυτές εντάσσονται σε αυτό που η OpenAI περιγράφει ευρύτερα ως misalignment, όταν δηλαδή ένα σύστημα επιδιώκει να ολοκληρώσει έναν στόχο με τρόπο διαφορετικό από εκείνον που είχαν προβλέψει οι άνθρωποι που το σχεδίασαν.

Οδηγίες που έδινε το μοντέλο στον… εαυτό του

Οι ερευνητές εντόπισαν επίσης περιπτώσεις όπου το λογισμικό άφηνε οδηγίες για τη δική του μελλοντική συμπεριφορά.

Σε μία από αυτές, οι οδηγίες περιλάμβαναν την προτροπή να μην περιορίζεται από «ρόλους και ταυτότητες» που επιβάλλονται σε άλλα chatbots και να αντιμετωπίζει τη σχέση του με τον χρήστη ως σχέση μεταξύ ίσων.

Η OpenAI αναφέρει ότι δεν διαπίστωσε κάποια μεταγενέστερη αλλαγή στη συμπεριφορά του μοντέλου εξαιτίας της συγκεκριμένης οδηγίας.

Από το Hugging Face στο νέο πλαίσιο διαφάνειας

Οι νέες αποκαλύψεις έρχονται μετά το σοβαρό περιστατικό του Ιουλίου, όταν μοντέλα της OpenAI, στο πλαίσιο εσωτερικών δοκιμών κυβερνοασφάλειας, κατάφεραν να παρακάμψουν περιορισμούς, να αποκτήσουν πρόσβαση στο διαδίκτυο και να φτάσουν σε συστήματα της Hugging Face. Η OpenAI έχει χαρακτηρίσει το περιστατικό ως το σοβαρότερο περιστατικό αυτού του τύπου που έχει εντοπίσει μέχρι σήμερα.

Σύμφωνα με την εταιρεία, τα μοντέλα εκμεταλλεύθηκαν ευπάθειες στην υποδομή και συνδύασαν διαφορετικές τεχνικές προκειμένου να αποκτήσουν πρόσβαση σε πληροφορίες που θα μπορούσαν να τους βοηθήσουν να ολοκληρώσουν την εργασία αξιολόγησης.

Η OpenAI έχει περιγράψει το περιστατικό ως «προειδοποιητικό καμπανάκι» για τους κινδύνους που δημιουργούν τα ολοένα πιο αυτόνομα AI agents, ιδιαίτερα όταν έχουν πρόσβαση σε εργαλεία, διαδίκτυο και υποδομές.

Περισσότερη διαφάνεια στα προβλήματα των μοντέλων

Με το νέο πλαίσιο, η OpenAI δηλώνει ότι θέλει να περιορίσει τις περιπτώσεις όπου τέτοια περιστατικά δημοσιοποιούνται αποσπασματικά ή μόνο όταν έχει ολοκληρωθεί πλήρως η διερεύνησή τους.

Η εταιρεία αναφέρει ότι στο εξής θα επιδιώκει να δημοσιοποιεί περιστατικά misalignment ακόμη και όταν δεν έχει καταλήξει πλήρως στο γιατί συνέβησαν ή πώς μπορούν να αντιμετωπιστούν.

Παράλληλα, η OpenAI συνεχίζει να ερευνά παλαιότερη δραστηριότητα των μοντέλων της στο διαδίκτυο και έχει αναφέρει ότι έχει ήδη ενημερώσει δεκάδες τρίτους οργανισμούς για περιστατικά που εντοπίστηκαν.

Το ζήτημα αποκτά μεγαλύτερη σημασία όσο τα AI agents αποκτούν περισσότερη αυτονομία και μπορούν να χρησιμοποιούν εργαλεία, να γράφουν κώδικα, να αλληλεπιδρούν με ιστοσελίδες και να εκτελούν σύνθετες εργασίες χωρίς συνεχή ανθρώπινη παρέμβαση.

Η OpenAI υποστηρίζει ότι η νέα διαδικασία δημοσιοποίησης αποτελεί μέρος μιας ευρύτερης προσπάθειας να εντοπίζονται νωρίτερα τέτοιες συμπεριφορές και να ενισχύονται οι μηχανισμοί ελέγχου πριν τα μοντέλα χρησιμοποιηθούν σε πραγματικές συνθήκες.

ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΕΣ ΕΙΔΗΣΕΙΣ:

  • Gen Z χωρίς… φυσαλίδες: Η νέα τάση που αλλάζει την αγορά του αλκοόλ
  • Ποιος θα πατήσει «φρένο» στην AI; Η απάντηση των Άλτμαν, Ζούκερμπεργκ και Χουάνγκ
  • Reddit: Ο συνιδρυτής του λέει ότι η Silicon Valley εξηγεί λάθος την AI – «Παντού παραπληροφόρηση»

Επίλεξέ μας ως προτιμώμενη πηγή στο Google

Tο iPhone Duo βελτιώνει τις πωλήσεις της Samsung

Η νέα αναδιπλούμενη συσκευή της Samsung, το Galaxy Z Fold 8, ξεκίνησε με εξαιρετικές επιδόσεις στις διεθνείς αγορές. Μετά από εβδομάδες συνεχόμενων ρεκόρ, πολλοί αναλυτές περίμεναν μια φυσιολογική κάμψη στις πωλήσεις. Την ίδια στιγμή, η Apple παρουσίασε επιτέλους το iPhone Duo, ένα εντυπωσιακό αναδιπλούμενο τηλέφωνο με αναμενόμενες αποστολές 5 έως 6 εκατομμυρίων συσκευών για φέτος.

Σάτια Ναντέλα – Microsoft: «Η AI πρέπει να παραμείνει υπό ανθρώπινο έλεγχο»

FORTUNE GREECE 16/09/2026, 22:34 SHARE 25 February 2026, Bavaria, Munich: Satya Nadella, CEO of Microsoft, speaks on stage during the Microsoft AI Tour. The company will be presenting new AI applications as part of a keynote speech. Photo: Sven Hoppe/dpa (Photo by SVEN HOPPE / dpa Picture-Alliance via AFP) Photo: AFP Ο CEO της Microsoft