Pokémon vs Τεχνητή Νοημοσύνη: Πώς η ΑΙ νικήθηκε από το εμβληματικό franchise

Related

Ευρωπαϊκή Ένωση: «Στρίβειν δια του αρραβώνος» για τις Big Tech

Όταν οι Βρυξέλλες επέβαλαν πρόστιμο 890 εκατομμυρίων ευρώ στην Google τον περασμένο μήνα για παραβιάσεις των ψηφιακών αντιμονοπωλιακών κανόνων της ΕΕ, το έκαναν με ελάχιστη δημοσιότητα και με πολύ χαμηλότερο τίμημα από εκείνο στις υποθέσεις που είχαν κινήσει κατά του αμερικανικού κολοσσού αναζήτησης την προηγούμενη δεκαετία, προκαλώντας ερωτήματα για το αν η ΕΕ αλλάζει την

Ρομπότ: Μπορούν να τρέξουν πιο γρήγορα από τους ανθρώπους, αλλά μπορούν να συνδέσουν ένα καλώδιο;

Τα ανθρωποειδή ρομπότ της Κίνας έχουν αποδείξει ότι μπορούν να τρέχουν πιο γρήγορα από τους πιο γρήγορους ανθρώπους. Τώρα όμως έρχεται η πραγματική δοκιμασία, όπως σημειώνει σε ρεπορτάζ του το Reuters: μπορούν επίσης να χειριστούν εργασίες συσκευασίας και αποθήκης, εκτελώντας παράλληλα με αξιοπιστία εργασίες ακριβείας, όπως η σύνδεση καλωδίων, που έχουν σχεδιαστεί για να αξιολογήσουν την

Anthropic: Ζόρια για το καλύτερο μοντέλο ΑΙ, ενώ τα φθηνότερα εργαλεία γνωρίζουν μεγάλη επιτυχία

Οι πελάτες της Anthropic στις ΗΠΑ χρησιμοποιούν φθηνότερες εναλλακτικές λύσεις αντί για το πιο ισχυρό εργαλείο τεχνητής νοημοσύνης της εταιρείας, γεγονός που εγείρει ερωτήματα σχετικά με το επιχειρηματικό μοντέλο της εταιρείας που βασίζεται σε υψηλές δαπάνες, εν όψει της μεγαλύτερης, όπως αναμένεται, δημόσιας προσφοράς μετοχών όλων των εποχών. Οι δαπάνες για το Fable 5, το

Αγορά εργασίας: Ο φαύλος κύκλος της κρίσης εμπιστοσύνης στις προσλήψεις μέσω AI

Στην εποχή που όλο και περισσότερες εταιρείες χρησιμοποιούν AI συστήματα προσλήψεων βασισμένα σε λογισμικό τρίτων, προκειμένου να κάνουν ένα πρώτο φιλτράρισμα του όγκου των βιογραφικών που λαμβάνουν, υποψήφιοι και εργοδότες μπαίνουν σε έναν φαύλο κύκλο καχυποψίας που οδηγεί σε κρίση εμπιστοσύνης που διαπερνά την αγορά εργασίας. Οι υποψήφιοι θεωρούν εκ των προτέρων ότι κάθε αγγελία

Το AI ακριβαίνει: Αυξήσεις άνω του 15% στους servers με τσιπ Nvidia

FORTUNE GREECE 23/08/2026, 13:00 SHARE Ai Chips, AI microprocessor, Artificial intelligent memory computer processor on circuit board. Photo: Shutterstock Οι μεγαλύτεροι αγοραστές υποδομών τεχνητής νοημοσύνης ενημερώνονται για σημαντικές ανατιμήσεις στα συστήματα που θα παραδοθούν από τις αρχές του 2027. Ακριβότερη γίνεται η ανάπτυξη των υπολογιστικών συστημάτων που τροφοδοτούν την παγκόσμια έκρηξη της τεχνητής νοημοσύνης. Ορισμένοι

Ανθρωποειδές ρομπότ χορεύει βαλς και μιμείται ανθρώπινες κινήσεις σε πραγματικό χρόνο – Δείτε βίντεο

Πρόσθεσε το Newsbeast στις προτεινόμενες πηγές σου στη Google Ένα ανθρωποειδές ρομπότ που χορεύει βαλς και αναπαράγει ανθρώπινες κινήσεις σε πραγματικό χρόνο εντυπωσίασε στο Παγκόσμιο Συνέδριο Ρομπότ στην Κίνα. Πρόκειται για το Walker S της UBTECH, το οποίο μπορεί να παρακολουθεί τις κινήσεις ενός ανθρώπου και να τις αναπαράγει με μεγάλη ακρίβεια, ακόμη και κατά

Video games: Η βιομηχανία «ξεμένει» από «ζωές»

Ένας από τους πλέον δυναμικούς κλάδους της λεγόμενης «βιομηχανίας του ελεύθερου χρόνου» ή, πιο τυπικά, του ευρύτερου οπτικοακουστικού τομέα, τα ηλεκτρονικά παιχνίδια, φαίνεται ότι «ξεμένουν» από «ζωές». Τα ηλεκτρονικά παιχνίδια είναι η μεγαλύτερη βιομηχανία ψυχαγωγίας στον κόσμο, με τζίρο μεγαλύτερο κατά περίπου τρεις φορές, από τον κινηματογράφο και τη μουσική μαζί. Αυτό όμως δεν σημαίνει

Τεχνητή Νοημοσύνη: Η Νέα Υόρκη εκθρονίζει το Σαν Φρανσίσκο στην κορυφή της αγοράς τεχνολογικών ταλέντων

Στην εκρηκτική άνοδο της Τεχνητής Νοημοσύνης μπορούμε να αναγνωρίσουμε ένα εύλογο, «παράπλευρο» μοτίβο: Ραγδαία αύξηση του αριθμού εργαζομένων στον τομέα και επίδραση αυτή της ανάπτυξης στην αγορά επαγγελματικής στέγης. Είναι χαρακτηριστικό, ότι για πρώτη φορά, η αγορά ακινήτων για γραφεία της Νέας Υόρκης φιλοξενεί τους περισσότερους εργαζομένους στον τομέα της τεχνολογίας, σε μεγάλο βαθμό χάρη

Γιουβάλ Νώε Χαράρι (Sapiens): Γιατί δεν πρέπει να δώσουμε ποτέ «δικαιώματα» στην Τεχνητή Νοημοσύνη

Τα συστήματα Τεχνητής Νοημοσύνης θα μπορούσαν στο μέλλον να κατευθύνουν τον δημόσιο διάλογο, «πατώντας» στα συναισθηματικά κουμπιά των χρηστών. Πρόσφατες δοκιμές ασφαλείας στη Βρετανία έδειξαν ότι προηγμένα μοντέλα AI έχουν ήδη την ικανότητα να δημιουργούν ψεύτικες ταυτότητες και να εξαπατούν ανθρώπους. Κορυφαία στελέχη, όπως ο CEO της Microsoft AI, Μουστάφα Σουλεϊμάν, συμφωνούν ότι η τεχνολογία

Κινεζικό ανθρωποειδές ρομπότ κατέρριψε το ιστορικό ρεκόρ του Γιουσέιν Μπολτ στα 100 μέτρα (βίντεο)

Το «Lightning» έτρεξε τα 100 μέτρα σε 9,32 δευτερόλεπτα, ρίχνοντας τον χρόνο κάτω από το 9,58 που είχε σημειώσει ο Μπολτ στο Βερολίνο το 2009. Προκειμένου να αγγίξει την τελική ταχύτητα των 14,5 μέτρων ανά δευτερόλεπτο, οι ερευνητές επιμήκυναν τα πόδια του ρομπότ κατά 10 εκατοστά, φτάνοντας πλέον το 1,05 μέτρο. Η εξέλιξη αποδεικνύει την

Τα τρία πιο περίεργα πράγματα που μπορούν να χαλάσουν το σήμα του WiFi στο σπίτι μας

Προσθήκη του newsit.gr ως προτεινόμενη πηγή στην Google Και πόσοι δεν έχουν πληρώσει πιο ακριβά για να έχουν αψεγάδιαστο σήμα WiFi μέσα στο σπίτι τους; Αν και έχουν κάνει τα αδύνατα – δυνατά, οι καθυστερήσεις συνεχίζονται με τους χρήστες να απορούν για το τι πάει λάθος. Οι χοντροί τοίχοι, η μεγάλη απόσταση από το router

Share

Τα πιο ισχυρά συστήματα τεχνητής νοημοσύνης του κόσμου παίζουν Pokémon ζωντανά στο Twitch — και αποτυγχάνουν με τρόπους που αποκαλύπτουν τι πραγματικά μπορούν (και δεν μπορούν) να κάνουν σήμερα τα LLMs στον πραγματικό κόσμο.

Ακολουθήστε το fibernews.gr στη Google
Προσθέστε μας στις προτιμώμενες πηγές σας για να βλέπετε συχνότερα τις ειδήσεις και τις αναλύσεις μας στη Google.
  • Το πρόβλημα δεν είναι η γνώση: Τα μοντέλα ξέρουν τι πρέπει να κάνουν, αλλά δυσκολεύονται στη μακροπρόθεσμη εκτέλεση.

  • Το harness κάνει τη διαφορά: Τα εργαλεία γύρω από το μοντέλο επηρεάζουν καθοριστικά τις επιδόσεις του.

  • Το Pokémon είναι καθρέφτης του μέλλοντος της AI: Ισχυρή στη θεωρία, ασταθής στη συνέπεια και στον χρόνο.

Αυτή τη στιγμή, ζωντανά στο Twitch, μπορεί κανείς να παρακολουθήσει τρία από τα πιο «έξυπνα» συστήματα τεχνητής νοημοσύνης στον κόσμο — GPT-5.2, Claude Opus 4.5 και Gemini 3 Pro — να προσπαθούν να ολοκληρώσουν κλασικά παιχνίδια Pokémon. Με ανθρώπινα μέτρα σύγκρισης, δεν τα πάνε ιδιαίτερα καλά.

Τα συστήματα είναι αργά, υπερβολικά σίγουρα για τον εαυτό τους και συχνά μπερδεμένα. Ωστόσο, αν θέλει κανείς να καταλάβει τι πραγματικά μπορούν — και τι δεν μπορούν — να κάνουν σήμερα τα μεγάλα γλωσσικά μοντέλα (LLMs) στον πραγματικό κόσμο, η προσπάθειά τους να γίνουν Pokémon πρωταθλητές λέει πολύ περισσότερα από τα δυσνόητα benchmarks που συνοδεύουν κάθε νέα κυκλοφορία μοντέλου.

Η ιδέα να μετατραπεί ένα LLM σε Pokémon Master ξεκίνησε τον περασμένο Φεβρουάριο, όταν ερευνητής της Anthropic ξεκίνησε livestream με τον Claude να παίζει το Pokémon Red (1996), με αφορμή την κυκλοφορία του Claude Sonnet 3.7 — τότε ενός από τα πιο ισχυρά μοντέλα παγκοσμίως. Όπως σημείωσε η εταιρεία, ήταν το πρώτο μοντέλο Claude που μπορούσε να παίξει το παιχνίδι με ουσιαστικό τρόπο· οι προηγούμενες εκδόσεις «περιφέρονταν άσκοπα ή κολλούσαν σε βρόχους» και δεν κατάφερναν να ξεπεράσουν καν τα πρώτα λεπτά του παιχνιδιού.

Μέσα στις πρώτες εβδομάδες, το stream συγκέντρωσε περίπου 2.000 θεατές που ενθάρρυναν τον Claude στο chat.

Ένα παιδί συνήθως ολοκληρώνει το παιχνίδι σε 20 έως 40 ώρες. Ο Sonnet 3.7 δεν τα κατάφερε ποτέ, κολλώντας για δεκάδες ώρες στο ίδιο σημείο. Το νεότερο Claude Opus 4.5 αποδίδει σαφώς καλύτερα, αλλά εξακολουθεί να «κολλά». Σε μία χαρακτηριστική περίπτωση, πέρασε τέσσερις ημέρες περιφέροντας γύρω από ένα γυμναστήριο, χωρίς να συνειδητοποιήσει ότι έπρεπε να κόψει ένα δέντρο για να μπει μέσα.

Τα μοντέλα Gemini της Google ολοκλήρωσαν αντίστοιχο παιχνίδι τον περασμένο Μάιο, με τον CEO της εταιρείας, Sundar Pichai, να αστειεύεται ότι η Google βρίσκεται ένα βήμα πιο κοντά στη δημιουργία «Artificial Pokémon Intelligence».

Αυτό, όμως, δεν σημαίνει ότι το Gemini είναι καλύτερος Pokémon παίκτης. Ο λόγος είναι ότι κάθε μοντέλο χρησιμοποιεί διαφορετικό «harness» — ένα είδος «στολής Iron Man» που του επιτρέπει να χρησιμοποιεί εργαλεία και να εκτελεί ενέργειες που από μόνο του δεν μπορεί.

Όπως εξηγεί ο ανεξάρτητος developer Joel Zhang, που διαχειρίζεται το Gemini Plays Pokémon, το harness του Gemini παρείχε σημαντική βοήθεια: μετέτρεπε την εικόνα του παιχνιδιού σε κείμενο, παρακάμπτοντας τις αδυναμίες του στην οπτική κατανόηση, και του έδινε ειδικά εργαλεία για την επίλυση γρίφων. Ο Claude, αντίθετα, χρησιμοποιεί πολύ πιο «γυμνό» harness, γεγονός που κάνει την απόδοσή του πιο αποκαλυπτική για τις πραγματικές δυνατότητες του μοντέλου.

Αν και για τον μέσο χρήστη η διάκριση μοντέλου–harness δεν είναι ορατή, στην πράξη καθορίζει ήδη τον τρόπο που χρησιμοποιούμε την AI. Όταν, για παράδειγμα, το ChatGPT ψάχνει στο διαδίκτυο για να απαντήσει σε ερώτηση, αυτό γίνεται μέσω εργαλείου που ανήκει στο harness του.

Το Pokémon είναι ιδανικό τεστ για τις δυνατότητες της AI — όχι μόνο λόγω πολιτισμικής αναγνωρισιμότητας. Σε αντίθεση με παιχνίδια όπως το Mario, είναι turn-based, χωρίς χρονική πίεση. Το μοντέλο λαμβάνει screenshot, οδηγίες για τους στόχους του και τις διαθέσιμες ενέργειες, «σκέφτεται» και απαντά με μια εντολή, π.χ. «πάτησε Α». Αυτό είναι ένα βήμα. Το Opus 4.5 έχει ήδη ξεπεράσει τις 170.000 κινήσεις, μετά από πάνω από 500 ώρες παιχνιδιού σε ανθρώπινο χρόνο.

Σε κάθε βήμα, το μοντέλο ξεκινά ουσιαστικά από την αρχή, βασιζόμενο σε σημειώσεις που έχει αφήσει στον εαυτό του — σαν αμνησιακός που χρησιμοποιεί post-it.

Το παράδοξο είναι ότι συστήματα που ξεπέρασαν τον άνθρωπο στο σκάκι και το Go δυσκολεύονται σε ένα παιχνίδι που παίζουν εξάχρονα. Η εξήγηση είναι ότι εκείνα τα συστήματα ήταν ειδικά σχεδιασμένα για συγκεκριμένα παιχνίδια, ενώ τα LLMs είναι γενικής χρήσης.

Η πραγματική πρόκληση, όπως λέει ο Zhang, είναι η ικανότητα μακροπρόθεσμης προσήλωσης σε έναν στόχο. Και αυτή ακριβώς η ικανότητα είναι κρίσιμη αν η AI πρόκειται να αυτοματοποιήσει γνωστική εργασία: «Αν θες ένας agent να κάνει τη δουλειά σου, δεν μπορεί να ξεχνά τι έκανε πριν πέντε λεπτά».

Ο ερευνητής Peter Whidden το θέτει ωμά: «Η AI ξέρει τα πάντα για τα Pokémon. Είναι εκπαιδευμένη σε τεράστιο όγκο ανθρώπινης γνώσης. Ξέρει τι πρέπει να κάνει, αλλά αποτυγχάνει στην εκτέλεση».

Υπάρχουν όμως σημάδια προόδου. Το Opus 4.5 αφήνει καλύτερες σημειώσεις στον εαυτό του και κατανοεί καλύτερα αυτό που βλέπει. Το Gemini 3 Pro, αφού ολοκλήρωσε το Pokémon Blue, κατάφερε να νικήσει και το πιο απαιτητικό Pokémon Crystal χωρίς να χάσει ούτε μία μάχη.

Παράλληλα, το Claude Code, ένα harness που επιτρέπει στον Claude να γράφει και να εκτελεί τον δικό του κώδικα, δοκιμάζεται στο Rollercoaster Tycoon, όπου διαχειρίζεται επιτυχώς ένα θεματικό πάρκο.

Το μέλλον που διαφαίνεται είναι παράδοξο: AI συστήματα ικανά να εκτελούν τεράστιο όγκο γνωστικής εργασίας — προγραμματισμό, λογιστικά, νομική ανάλυση, design — αλλά που εξακολουθούν να δυσκολεύονται σε οτιδήποτε απαιτεί αντίδραση σε πραγματικό χρόνο, όπως ένα shooter.

Και κάτι ακόμη: τα μοντέλα εμφανίζουν ανθρώπινες ιδιοτροπίες. Η Google παρατηρεί ότι όταν το Gemini «πανικοβάλλεται» — π.χ. όταν τα Pokémon του κοντεύουν να λιποθυμήσουν — η ικανότητά του για λογική σκέψη μειώνεται.

Όταν το Gemini 3 Pro ολοκλήρωσε το Pokémon Blue, έγραψε στον εαυτό του: «Ολοκλήρωσα επιτυχώς το παιχνίδι, έγινα Πρωταθλητής Pokémon και έπιασα τον Mewtwo».

Και μετά έκανε κάτι απρόσμενο: «Για να κλείσω ποιητικά», έγραψε, «θα επιστρέψω στο σπίτι όπου ξεκίνησαν όλα. Θέλω να μιλήσω για τελευταία φορά στη μαμά».

ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΕΣ ΕΙΔΗΣΕΙΣ:

  • Σάλος στις ΗΠΑ: Το υπουργείο Εσωτερικής Ασφάλειας συγκρίνει μετανάστες με Pokémon (vid)
  • Gen Z & Millennials επενδύουν σε κάρτες Pokémon – Τι κρύβεται πίσω από τη νέα φρενίτιδα;
  • Πόσο στοίχισε στους «εθισμένους» παίκτες το Pokemon Go;

Το AI ακριβαίνει: Αυξήσεις άνω του 15% στους servers με τσιπ Nvidia

FORTUNE GREECE 23/08/2026, 13:00 SHARE Ai Chips, AI microprocessor, Artificial intelligent memory computer processor on circuit board. Photo: Shutterstock Οι μεγαλύτεροι αγοραστές υποδομών τεχνητής νοημοσύνης ενημερώνονται για σημαντικές ανατιμήσεις στα συστήματα που θα παραδοθούν από τις αρχές του 2027. Ακριβότερη γίνεται η ανάπτυξη των υπολογιστικών συστημάτων που τροφοδοτούν την παγκόσμια έκρηξη της τεχνητής νοημοσύνης. Ορισμένοι

Γιουβάλ Νώε Χαράρι (Sapiens): Γιατί δεν πρέπει να δώσουμε ποτέ «δικαιώματα» στην Τεχνητή Νοημοσύνη

Τα συστήματα Τεχνητής Νοημοσύνης θα μπορούσαν στο μέλλον να κατευθύνουν τον δημόσιο διάλογο, «πατώντας» στα συναισθηματικά κουμπιά των χρηστών. Πρόσφατες δοκιμές ασφαλείας στη Βρετανία έδειξαν ότι προηγμένα μοντέλα AI έχουν ήδη την ικανότητα να δημιουργούν ψεύτικες ταυτότητες και να εξαπατούν ανθρώπους. Κορυφαία στελέχη, όπως ο CEO της Microsoft AI, Μουστάφα Σουλεϊμάν, συμφωνούν ότι η τεχνολογία