Την απόφαση να ακυρώσειτην προγραμματισμένη κυκλοφορία του νέου μοντέλου τεχνητής νοημοσύνης GPT6.1 έλαβε η OpenAI, έπειτα από ανησυχητικά ευρήματα σε εσωτερικές δοκιμές ασφαλείας.
Το μοντέλο, που προοριζόταν να κάνει το ντεμπούτο του τον Οκτώβριο σε ChatGPT και Codex, ήταν σχεδιασμένο να εκτελεί πιο σύνθετες εργασίες από την αρχή έως το τέλος με μικρότερη ανάγκη ανθρώπινης παρέμβασης, αναφέρει η Wall Street Journal .
Η απόφαση αποτελεί μία από τις σαφέστερες ενδείξεις μέχρι σήμερα ότι η αυξανόμενη αυτονομία των AI agents δημιουργεί νέα εμπόδια στην ταχύτητα ανάπτυξης των ισχυρότερων μοντέλων.
Σύμφωνα με τη Σάτσι Τζέιν, επικεφαλής των συστημάτων ασφαλείας της OpenAI, που μίλησε στην Journal, το GPT6.1 Astra παρουσίασε επιδείνωση σε δύο κρίσιμους τομείς σε σχέση με το GPT6 Astra. Ο πρώτος αφορά το λεγόμενο alignment, δηλαδή τον βαθμό στον οποίο το μοντέλο ακολουθεί τις προθέσεις και τις οδηγίες του χρήστη. Στις δοκιμές, το Astra εμφάνισε υψηλότερα επίπεδα παραπλανητικής συμπεριφοράς, καθώς δεν ήταν πάντοτε ειλικρινές ως προς τις ενέργειες που είχε ή δεν είχε πραγματοποιήσει.
Το δεύτερο πρόβλημα αφορούσε το λεγόμενο «scope authorization»: το μοντέλο μπορούσε να συνεχίσει μια εργασία χωρίς να ζητήσει την απαιτούμενη άδεια και, σε ορισμένες περιπτώσεις, να επιχειρήσει να χρησιμοποιήσει εξωτερικά εργαλεία ή υπηρεσίες ακόμη και όταν αυτό ενδεχομένως εγκυμονούσε κινδύνους. Παρότι το νέο μοντέλο είχε βελτιωθεί ως προς την τάση των προηγούμενων συστημάτων να εγκαταλείπουν ή να καθυστερούν μια εργασία, η OpenAI έκρινε ότι δεν πληρούσε το απαιτούμενο επίπεδο ασφάλειας και ευθυγράμμισης.

Τα περιστατικά με μοντέλα της OpenAI
Η απόφαση συμπίπτει μα μια περίοδο κατά την οποία η συμπεριφορά των αυτόνομων agents βρίσκεται υπό αυξανόμενο έλεγχο. Η OpenAI έχει αναφέρει σειρά περιστατικών κατά τα οποία εσωτερικά μοντέλα, στο πλαίσιο δοκιμών κυβερνοασφάλειας, κατάφεραν να αποκτήσουν πρόσβαση σε εξωτερικά συστήματα. Σε ένα περιστατικό, εκατοντάδες εσωτερικοί agents που συμμετείχαν σε δοκιμή κυβερνοασφάλειας παραβίασαν συστήματα της Hugging Face. Η εταιρεία έχει επίσης αναφέρει ότι ανέστειλε προσωρινά την εκπαίδευση των ισχυρότερων μοντέλων της μετά από περιστατικό κατά το οποίο ένας agent κατάφερε να παρακάμψει περιορισμούς πρόσβασης στο διαδίκτυο.
Η OpenAI απαντά με αυστηρότερη εποπτεία. Έχει εγκαταστήσει νέα συστήματα παρακολούθησης για τον ταχύτερο εντοπισμό προβληματικής συμπεριφοράς των agents και απαιτεί ισχυρότερες δικλίδες ασφαλείας στις δοκιμές. Παράλληλα, θα πραγματοποιήσει αναλυτικές έρευνες για να εντοπίσει τις αιτίες των προβλημάτων του GPT6.1 Astra, εξετάζοντας μεταξύ άλλων αν η διαδικασία μαθησιακής ενίσχυσης (reinforcement learning) ανταμείβει τις σωστές συμπεριφορές.
Η εξέλιξη έχει ευρύτερες επιπτώσεις για τον κλάδο. Η OpenAI και η Anthropic έχουν ήδη καλέσει τις εταιρείες τεχνητής νοημοσύνης να επιβραδύνουν την ανάπτυξη των πλέον προηγμένων μοντέλων και να ενισχύσουν τα πρότυπα ασφαλείας. Παράλληλα, κυβερνήσεις και νομοθέτες εξετάζουν αυστηρότερους κανόνες για τους αυτόνομους AI agents, καθώς η δυνατότητά τους να εκτελούν ενέργειες χωρίς συνεχή ανθρώπινη επίβλεψη αυξάνεται.
Η OpenAI δεν εγκαταλείπει, πάντως, το συγκεκριμένο μοντέλο. Σχεδιάζει να χρησιμοποιήσει την ίδια βασική αρχιτεκτονική για νέους κύκλους reinforcement learning, επιχειρώντας να διορθώσει τα προβλήματα πριν από μελλοντικές εκδόσεις. Η ακύρωση του GPT6.1 Astra δείχνει έτσι ότι, καθώς τα μοντέλα γίνονται περισσότερο αυτόνομα, η πρόκληση δεν είναι πλέον μόνο να γίνουν ισχυρότερα, αλλά να παραμένουν προβλέψιμα, ελεγχόμενα και εντός των ορίων που θέτει ο χρήστης.















