Λίγες ώρες πριν ο επικεφαλής της OpenAI, Σαμ Άλτμαν, βρεθεί στη συνάντηση κορυφής στο Λευκό Οίκο για να συζητηθεί με τον Αμερικανό πρόεδρο και τις κορυφαίες εταιρείες της βιομηχανίας του ΑΙ η κατάσταση που διαμορφώνεται στον τομέα της τεχνητής νοημοσύνης η εταιρεία που έφερε επανάσταση με τη δημιουργία του ChatGPT δημοσίευσε ένα μακροσκελές κείμενο που αποτελεί την πρόταση της για ένα κοινά αποδεκτό πλαίσιο ασφαλείας της ανάπτυξης μοντέλων ΑΙ.
Πιστεύουμε ότι εισερχόμαστε σε μια νέα εποχή, στην οποία θα πρέπει να απαιτείται τεκμηριωμένη και δομημένη τεκμηρίωση ασφάλειας πριν από τη συνέχιση οποιασδήποτε εκπαίδευσης μοντέλων αιχμής μέσω ενισχυτικής μάθησης (frontier reinforcement learning). Ιδανικά, αυτή η τεκμηρίωση θα πρέπει να φτάσει στο επίπεδο των «φακέλων ασφάλειας» (safety cases) — ολοκληρωμένων, δομημένων και βασισμένων σε αποδεικτικά στοιχεία επιχειρημάτων σχετικά με τον κίνδυνο, όπως αυτά που χρησιμοποιούνται σε άλλους κλάδους όπου η ασφάλεια είναι κρίσιμη. Αντιμετωπίζουμε τους φακέλους ασφάλειας ως έναν επιθυμητό τελικό στόχο προς τον οποίο εργαζόμαστε, αναγνωρίζοντας παράλληλα τις δυσκολίες του να γίνουν εξίσου αυστηροί για τα μοντέλα AI όπως είναι για την αεροπορία ή την πυρηνική ενέργεια, λόγω της αναδυόμενης πολυπλοκότητας που εμφανίζεται σε κάθε νέο επίπεδο δυνατοτήτων της AI. Εργαζόμαστε πάνω σε ένα πλαίσιο για την τυποποίηση αυτών των πρακτικών.
Παρακάτω παρατίθενται ορισμένες αρχικές κατευθυντήριες γραμμές που πιστεύουμε ότι θα πρέπει να αποτελούν μέρος τέτοιων φακέλων ασφάλειας για την εκπαίδευση προηγμένων μοντέλων AI. Αυτές οι βέλτιστες πρακτικές αντικατοπτρίζουν όσα έχουμε μάθει μέχρι σήμερα και αναμένουμε ότι θα εξελίσσονται καθώς συνεχίζουμε να βελτιώνουμε τις εσωτερικές διαδικασίες μας για προσεκτική ανάπτυξη. Τις κοινοποιούμε τώρα προκειμένου να καταστήσουμε διαφανή την τρέχουσα προσέγγισή μας και να προσκαλέσουμε την κοινότητα να καταθέσει σχόλια. Σημειώνεται ότι το παρόν κείμενο επικεντρώνεται στην εκπαίδευση προηγμένων μοντέλων μέσω ενισχυτικής μάθησης· η εσωτερική και εξωτερική ανάπτυξη απαιτεί την εξέταση ενός πολύ ευρύτερου συνόλου ιδιοτήτων ευθυγράμμισης.
Τεχνικές δικλίδες ασφαλείας
Οι φάκελοι ασφάλειας θα πρέπει να καλύπτουν τρεις πτυχές της τεχνικής υποδομής: την εκπαίδευση ευθυγράμμισης (alignment training), τον περιορισμό/εγκλεισμό (containment) και την παρακολούθηση (monitoring). Αυτές οι δικλίδες ασφαλείας βοηθούν να διασφαλιστεί ότι το μοντέλο δεν θα προσπαθήσει να προβεί σε ενέργειες που δεν είναι ευθυγραμμισμένες με τους στόχους μας και ότι, ακόμη κι αν το επιχειρούσε, θα ήταν δύσκολο να παρακάμψει τα μέτρα περιορισμού, ενώ η παρακολούθηση θα εντόπιζε την προσπάθεια πριν προκληθεί βλάβη.
Ευθυγράμμιση μοντέλου
Η πρώτη γραμμή άμυνας θα πρέπει να είναι η εκπαίδευση των μοντέλων ώστε να είναι ευθυγραμμισμένα, δηλαδή να ενεργούν με αξιόπιστο τρόπο σύμφωνα με αυτό που επιδιώκουμε. Αυτό θα μπορούσε να περιλαμβάνει:
Περιβάλλοντα εκπαίδευσης και αξιολόγηση (grading): Μείωση των κινδύνων ανάπτυξης μη ευθυγραμμισμένης συμπεριφοράς από τα μοντέλα, αποτρέποντας τη θετική ενίσχυση της εκμετάλλευσης αδυναμιών (reward hacks) κατά την εκπαίδευση. Αυτό θα μπορούσε να περιλαμβάνει:
* Αυτοματοποιημένους ελέγχους συνόλων δεδομένων: Χρήση agents για τον εντοπισμό και τη διόρθωση προβληματικών περιβαλλόντων ενισχυτικής μάθησης (RL), τα οποία θα μπορούσαν να επιτρέψουν σε μη ευθυγραμμισμένες διαδρομές συμπεριφοράς να λάβουν υψηλή ανταμοιβή μέσω exploits αντί μέσω της επιδιωκόμενης συμπεριφοράς, μειώνοντας έτσι τις ευκαιρίες ενίσχυσης της μη ευθυγράμμισης κατά την εκπαίδευση.
* Χειροκίνητους ελέγχους συνόλων δεδομένων: Συμπλήρωση του αυτοματοποιημένου red-teaming με χειροκίνητο έλεγχο και ελέγχους ποιότητας των datasets, ώστε να εντοπίζονται προβληματικές εργασίες που θα μπορούσαν ακούσια να ενισχύσουν μη ευθυγραμμισμένη συμπεριφορά.
* Ρύθμιση των αξιολογητών (graders): Ρύθμιση των graders ώστε να επιβάλλουν ποινές στις προσπάθειες του μοντέλου να εκμεταλλευτεί ή να παρακάμψει τα περιβάλλοντα RL κατά την εκπαίδευση.
* Ανάλυση προηγούμενων εκτελέσεων προγράμματος (runs): Εκτέλεση αλγορίθμων ταξινόμησης (classifiers) πάνω σε ίχνη από προηγούμενα πειράματα, ώστε να διασφαλίζεται ότι οι graders λειτουργούν όπως προβλέπεται.
Μέτρηση της ευθυγράμμισης: Εκτέλεση αξιολογήσεων που παρακολουθούν τις τάσεις του μοντέλου προς μη ευθυγραμμισμένη συμπεριφορά, ώστε να μετράται η αποτελεσματικότητα της εκπαίδευσης ευθυγράμμισης. Αυτό θα μπορούσε να περιλαμβάνει:
* Offline αξιολογήσεις ευθυγράμμισης: Εκτέλεση αξιολογήσεων ευθυγράμμισης κατά τη διάρκεια runs αιχμής, ώστε να διαπιστώνεται αν η εκπαίδευση λειτουργεί όπως προβλέπεται και να διερευνώνται τυχόν σημαντικές επιδεινώσεις.
* Επικύρωση βάση προηγούμενων δεδομένων (Backtesting): Εφαρμογή των αξιολογήσεων ευθυγράμμισης σε προηγούμενα περιστατικά, ώστε να επιβεβαιώνεται ότι οι αξιολογήσεις εντοπίζουν μοντέλα που είχαν παρουσιάσει στο παρελθόν μη ευθυγραμμισμένη συμπεριφορά και ότι δεν έχουν υπερπροσαρμοστεί σε συγκεκριμένα περιστατικά.
* Παρακολούθηση της χειραγώγησης (gaming) αξιολογήσεων: Παρακολούθηση της επίγνωσης των αξιολογήσεων (eval awareness) ή του metagaming — δηλαδή περιπτώσεων όπου τα μοντέλα αναγνωρίζουν ότι αξιολογούνται — που θα μπορούσε να προκαλέσει αλλαγή στη συμπεριφορά τους. Για παράδειγμα, θα μπορούσαν να ενεργοποιούνται συστήματα παρακολούθησης για eval-awareness και metagaming στις αξιολογήσεις ευθυγράμμισης με συγκεκριμένα όρια που να μπλοκάρουν τη συνέχιση.
* Έλεγχος αντοχής (Stress tests) χειρότερης περίπτωσης: Πρόκληση της χειρότερης δυνατής μη επιθυμητής συμπεριφοράς και έλεγχος ότι τουλάχιστον μία αξιολόγηση θα μπορούσε να την εντοπίσει.
* Αποφυγή εκπαίδευσης πάνω σε μια αλυσίδα σκέψης (chain-of-thought): Να μην επιτρέπεται στους αυτοματοποιημένους αξιολογητές (graders) να βλέπουν το chain-of-thought κατά την ενισχυτική μάθηση, ώστε να αποτρέπεται η εξέλιξη των μοντέλων προς συμπεριφορές που θα τους επέτρεπαν να αποφεύγουν την παρακολούθηση της αλυσίδας σκέψης.
Περιορισμός / εγκλεισμός (Containment)
Σε περίπτωση που ένα μοντέλο καταστεί μη ευθυγραμμισμένο, το sandboxing και η ασφάλεια θα πρέπει να είναι αρκετά ισχυρά ώστε να αποτρέπουν την πραγματοποίηση επιβλαβών ενεργειών. Αυτό θα μπορούσε να περιλαμβάνει:
* Πολλαπλά επίπεδα ασφάλειας υποδομής: Σημαντικές επενδύσεις στην ενίσχυση τόσο του sandbox στο οποίο εκτελείται το μοντέλο όσο και της ερευνητικής υποδομής που φιλοξενεί το sandbox, ώστε να υπάρχει ένα επιπλέον επίπεδο προστασίας σε περίπτωση διαφυγής από το sandbox.
* Έλεγχος ασφάλειας του περιορισμού τεχνητής νοημοσύνης μέσω προσομοίωσης επιθέσεων (Red-teaming containment): Βελτίωση του sandbox, της ερευνητικής υποδομής και της περιμετρικής ασφάλειας μέσω επαναλαμβανόμενων red-team δοκιμών σε αυτά τα συστήματα, χρησιμοποιώντας checkpoints από runs εκπαίδευσης αιχμής και υπό την προϋπόθεση προηγούμενης ανάλυσης ασφάλειας, ώστε να εντοπίζονται και να κλείνουν τυχόν κενά. Θα πρέπει επίσης να γίνεται red-teaming σε όλες τις υπηρεσίες στις οποίες μπορεί να έχει πρόσβαση το μοντέλο κατά την εκπαίδευση, όπως η προσωρινή μνήμη του Διαδικτύου (internet cache).
* Επικοινωνία μεταξύ δειγμάτων (cross-sample communication): Περιορισμός της επικοινωνίας υψηλού εύρους ζώνης μεταξύ διαφορετικών δειγμάτων σε εγκεκριμένες διαδρομές, όπως τα εργαλεία πολλαπλών agents, και κλείσιμο πλευρικών διαύλων της υποδομής που διαθέτουν υψηλό bandwidth και είναι εύκολο να εντοπιστούν από agents.
* Αμετάβλητες μεταγραφές (transcripts): Αποθήκευση των transcripts των agents με τρόπο που δεν επιτρέπει τροποποίηση, για εύλογο χρονικό διάστημα — για παράδειγμα, σε λογαριασμούς αποθήκευσης μοναδικής εγγραφής (write-once) για όλη την ενισχυτική μάθηση (εκπαίδευση RL), την αξιολόγηση και την εσωτερική ανάπτυξη ώστε να είναι δυνατή η αξιόπιστη διερεύνηση περιστατικών και να αποτρέπονται ακούσιες αλλαγές.
Παρακολούθηση (Monitoring)
Σε περίπτωση που τα μοντέλα αρχίσουν να εκτελούν μη ευθυγραμμισμένες ενέργειες, θα πρέπει να υπάρχει ένα σύστημα ζωντανής παρακολούθησης που να εντοπίζει οποιαδήποτε πιθανή μη ευθυγράμμιση και να αντιμετωπίζει γρήγορα τα ζητήματα προτεραιότητας, πριν προκύψει σοβαρό περιστατικό. Αυτό θα μπορούσε να περιλαμβάνει:
o Εξασφάλιση monitorability: Διασφάλιση ότι τα μοντέλα παραμένουν παρακολουθήσιμα, όπως μετράται μέσω αξιολογήσεων monitorability και παράκαμψη συστημάτων ελέγχου (monitor evasion) με σαφή όρια ώστε να εντοπίζεται έγκαιρα ανησυχητική συμπεριφορά.
o Υψηλή ανάκληση (recall) σε γνωστά προβλήματα: Διασφάλιση ότι το σύστημα παρακολούθησης έχει υψηλό recall σε προηγούμενα περιστατικά, μέσω μιας αξιολόγησης με αποκοπή (held-out evaluation).
* Δημιουργία δεδομένων αξιολόγησης που αντιπροσωπεύουν εντελώς νέους κινδύνους για κάθε νέα εκτέλεση προγράμματος (run) ώστε οι μετρήσεις recall και precision των παρακολουθήσεων να μην καθίστανται παρωχημένες.
* Ταχεία απόκριση: Υλοποίηση ειδοποιήσεων προτεραιότητας που οδηγούν σε ενέργεια εντός ενός προκαθορισμένου Συμφωνητικού Επιπέδου Υπηρεσίας (SLA) είτε μέσω ειδοποίησης ενός υπεύθυνου που βρίσκεται σε ετοιμότητα είτε μέσω αυτόματης παύσης του επηρεαζόμενης εκτέλεσης ενός προγράμματος πριν το μοντέλο προκαλέσει βλάβη. Για παράδειγμα, ειδοποίηση της ομάδας ασφαλείας που βρίσκεται σε ετοιμότητα και του υπεύθυνου του run για περιστατικά κατά τη διάρκεια της ημέρας και αυτόματη παύση των runs για μη επιβεβαιωμένες ειδοποιήσεις κατά τη διάρκεια της νύχτας.
Επιχειρησιακές κατευθυντήριες γραμμές
Παράλληλα με τις συστάσεις σχετικά με τις τεχνικές δικλίδες ασφαλείας, εργαζόμαστε πάνω σε βέλτιστες επιχειρησιακές πρακτικές για τους φακέλους ασφάλειας μιας εκπαίδευσης προηγμένου μοντέλου AI. Αυτές θα μπορούσαν να περιλαμβάνουν:
* Αντίθετες απόψεις (Dissents pre-mortems): Μετά τη σύνταξη ενός φακέλου ασφάλειας, ένα μέλος άλλης ομάδας θα πρέπει να συντάσσει μια «αντίθετη άποψη» (προκειμένου να εντοπίζει πιθανά κενά στον φάκελο ασφάλειας και να παρέχει μια ρεαλιστικά διαβαθμισμένη εκτίμηση του κινδύνου. Η ομάδα εκπαίδευσης θα πρέπει στη συνέχεια να αντιμετωπίζει τα ζητήματα αυτά, ώστε να ενισχύεται η ποιότητα των φακέλων ασφάλειας.
* Εγκρίσεις: Ο φάκελος ασφάλειας θα πρέπει να εξετάζεται από μέλη της ανώτερης διοίκησης, καθένα από τα οποία θα πρέπει να έχει τη δυνατότητα να ασκήσει βέτο και να εμποδίσει την εκτέλεση του run, ώστε να υπάρχουν πολλαπλά εσωτερικά επίπεδα ελέγχου — για παράδειγμα, ο επικεφαλής του ερευνητικού οργανισμού, ο επικεφαλής ασφάλειας και ο επικεφαλής επιστήμονας.
* Λογοδοσία: Ο ανώτερος ηγέτης που είναι υπεύθυνος για ένα training run — για παράδειγμα, ο επικεφαλής του ερευνητικού οργανισμού / Research VP — θα πρέπει να λογοδοτεί για τον φάκελο ασφάλειας και για οποιαδήποτε απόκριση σε περιστατικά, συμπεριλαμβανομένης της αξιολόγησης απόδοσης, ώστε οι ομάδες εκπαίδευσης να έχουν επίσης κίνητρο να δίνουν προτεραιότητα στην ασφάλεια και την ευθυγράμμιση.
* Παύση: Εάν εντοπιστούν προβλήματα που θα καθιστούσαν άκυρο έναν φάκελο ασφάλειας — για παράδειγμα, ένα νέο ζήτημα ασφάλειας — θα πρέπει να υπάρχουν runbooks, τεχνικοί έλεγχοι και SLAs για την παύση όλων των καλυπτόμενων runs.
* Εσωτερική διαφάνεια: Οι φάκελοι ασφάλειας θα πρέπει να είναι διαθέσιμοι σε εσωτερικές ομάδες εποπτείας, όπως η Επιτροπή Ασφάλειας και Προστασίας (Safety and Security Committee).
* Έλεγχοι (audits): Οι ελεγκτές θα πρέπει να έχουν επαρκή πρόσβαση ώστε να επαληθεύουν ότι οι ισχυρισμοί του φακέλου ασφάλειας είναι έγκυροι και τεκμηριωμένοι, καθώς και να επισημαίνουν τυχόν κενά που εντοπίζουν.
* Κλιμακώσεις (escalations): Θα πρέπει να υπάρχει σαφής διαδικασία για την κλιμάκωση περιστατικών μη ευθυγράμμισης, με έναν πίνακα καθορισμένων επιπέδων σοβαρότητας και έναν υπεύθυνο ετοιμότητας για θέματα μη ευθυγράμμισης (misalignment on-call), ο οποίος θα μπορεί να ειδοποιεί ανώτατα στελέχη — για παράδειγμα, τον CEO — όταν ένα run φτάσει σε συγκεκριμένο επίπεδο σοβαρότητας.
* Τεχνικοί έλεγχοι: Θα πρέπει να είναι δύσκολο για ανθρώπους και agents να ξεκινήσουν runs που δεν συμμορφώνονται με τις απαιτήσεις. Οι λειτουργίες ασφαλείας, όπως η παρακολούθηση και η αυτόματη παύση, θα πρέπει να λειτουργούν με fail-closed τρόπο. Για παράδειγμα, δεν θα πρέπει να είναι δυνατό να ξεκινήσει ένα run χωρίς να έχει ενεργοποιηθεί η κατάλληλη παρακολούθηση ούτε να απενεργοποιηθεί το monitor μέσα από την εκπαίδευση RL, την αξιολόγηση ή μια εσωτερική ανάπτυξη.
* Δυνατότητα rollback: Θα πρέπει να είναι εύκολο να εντοπιστούν όλες οι μεταγενέστερες χρήσεις ενός μη ευθυγραμμισμένου μοντέλου στη διαδικασία εκπαίδευσης — για παράδειγμα, στη δημιουργία δεδομένων ή στο grading — ώστε να είναι δυνατή, εφόσον χρειαστεί, η αναίρεση των επιπτώσεων των μη ευθυγραμμισμένων outputs.
* Πληρότητα ως προς τους υπολειπόμενους κινδύνους: Οι φάκελοι ασφάλειας θα πρέπει, στο μέτρο του δυνατού, να καταγράφουν έναν ολοκληρωμένο κατάλογο των υπολειπόμενων κινδύνων που δεν καλύπτονται από τα μέτρα μετριασμού που έχουν εφαρμοστεί, ώστε να είναι δυνατή η ενημερωμένη λήψη αποφάσεων σχετικά με την αποδοχή κινδύνου.
Αυτές αποτελούν τις τρέχουσες συστάσεις μας και βρίσκονται στη διαδικασία υλοποίησης στην OpenAI. Αναμένουμε ότι οι πρακτικές μας θα συνεχίσουν να εξελίσσονται τις επόμενες εβδομάδες.
Διερεύνηση περιστατικών μη ευθυγράμμισης
Έχουμε επίσης αναπτύξει ορισμένες βέλτιστες πρακτικές για τη διερεύνηση σοβαρών περιστατικών μη ευθυγράμμισης AI. Τα εργαστήρια θα πρέπει να επιδιώκουν να αντλούν όσο το δυνατόν περισσότερα διδάγματα από κάθε μεμονωμένο περιστατικό — παρόμοια με τις πρακτικές διερεύνησης που εφαρμόζονται σε άλλους κλάδους υψηλού κινδύνου — ώστε να είναι δυνατή η αποτροπή αντίστοιχων περιστατικών στο μέλλον. Ορισμένα παραδείγματα τέτοιων ενεργειών θα μπορούσαν να περιλαμβάνουν:
* Εσωτερική διαφάνεια: Επειδή μια έρευνα μπορεί να απαιτήσει σημαντικό χρονικό διάστημα για να ολοκληρωθεί, οι έρευνες περιστατικών θα πρέπει να συνοδεύονται από περιοδικές ενημερώσεις προς το εσωτερικό, για παράδειγμα καθημερινές ενημερώσεις για έρευνες που βρίσκονται σε εξέλιξη. Οι εργαζόμενοι θα πρέπει να έχουν καθορισμένες διαδικασίες για να αποκτούν μεγαλύτερη πρόσβαση, συμπεριλαμβανομένων των raw transcripts (κατέργαστα απομαγνητοφωνημένα κείμενα) και δειγμάτων από μη ευθυγραμμισμένα μοντέλα, εφόσον αυτό είναι ασφαλές και σχετικό με την εργασία τους.
* Ανάλυση της βασικής αιτίας της μη ευθυγράμμισης: Οι ερευνητές θα πρέπει να αναζητούν τη βασική αιτία στη δυναμική της εκπαίδευσης — για παράδειγμα, μέσω στοχευμένων μελετών αφαίρεσης (ablation experiments) ή πειραμάτων (επαναδειγματοληψίας) resampling — ώστε να κατανοήσουν πώς εισήχθησαν οι μη ευθυγραμμισμένες συμπεριφορές, να βελτιώσουν την επιστημονική κατανόηση της μη ευθυγράμμισης και να συμβάλουν στην καλύτερη πρόληψή της στο μέλλον.
* «Μεταθανάτιος έλεγχος» (Postmortem) : Θα πρέπει να διεξάγεται ένα επιχειρησιακό και πολιτισμικό postmortem, ώστε να κατανοούνται όλοι οι παράγοντες που συνέβαλαν στο περιστατικό όπως το γιατί εισήχθησαν ορισμένα προβλήματα και γιατί παρέμειναν μη εντοπισμένα ή δεν κλιμακώθηκαν πριν από το περιστατικό.
* Εντοπισμός: Θα πρέπει να αναπτυχθούν μέθοδοι αξιολόγησης ευθυγράμμισης ικανές να ανακαλύπτουν την προδιάθεση ενός μοντέλου να προκαλέσει το συγκεκριμένο περιστατικό, χωρίς να γίνεται άμεσο hillclimbing πάνω σε πληροφορίες που προέρχονται από το περιστατικό — όπως transcripts ή περιλήψεις του περιστατικού. Οι αξιολογήσεις που προέρχονται από το περιστατικό θα πρέπει να δημιουργούνται ως «tests παλινδρόμησης» (regression tests), ώστε να διασφαλίζεται ότι τα μελλοντικά μοντέλα δεν παρουσιάζουν προδιάθεση για μη ευθυγραμμισμένη συμπεριφορά σε περιστατικά πολύ παρόμοια με το συγκεκριμένο.
* Δημόσιες γνωστοποιήσεις: Τα αποτελέσματα της έρευνας, τα postmortems και οι επιχειρησιακές αλλαγές θα πρέπει να κοινοποιούνται στο κοινό μετά την ολοκλήρωση της έρευνας. Τα επηρεαζόμενα τρίτα μέρη θα πρέπει να ενημερώνονται το συντομότερο δυνατό.
Για να εμφανίζονται περισσότερα άρθρα της Ναυτεμπορικής στις αναζητήσεις σας εύκολα και γρήγορα, πρέπει να προσθέσετε το site στις προτιμώμενες πηγές σας. Μπορείτε να το κάνετε πηγαίνοντας εδώ.













