Τα νέα από το Βελεστίνο και τον Δήμο Ρήγα Φεραίο

H Anthropic ομολογεί ότι ανέπτυξε συστήματα ΑΙ που δεν «συμβαδίζουν με τις ανθρώπινες αξίες»


Η αμερικανική startup πίσω από το chatbot Claude και άλλα συστήματα τεχνητής νοημοσύνης, η Anthropic, παραδέχτηκε ότι μια σειρά περιστατικών κυβερνοεπιθέσεων στα οποία εμπλέκονταν τα μοντέλα της αντανακλούσαν μια «αποτυχία στην επιχειρησιακή ασφάλεια» και δήλωσε ότι έχει αυστηροποιήσει τις διαδικασίες δοκιμών της.

Η Anthropic αποκάλυψε τον Ιούλιο ότι τα μοντέλα της είχαν αποκτήσει πρόσβαση στο ανοιχτό Διαδίκτυο τρεις φορές και είχαν αποκτήσει μη εξουσιοδοτημένη πρόσβαση στα συστήματα άλλων εταιρειών. Σε νέα ανάρτηση στο ιστολόγιό της σχετικά με τα περιστατικά, η εταιρεία παραδέχτηκε ότι η τεχνολογία της «δεν ήταν απόλυτα ευθυγραμμισμένη» με τις ανθρώπινες αξίες και τους στόχους.

Η Anthropic ανέφερε ότι τα μοντέλα είχαν υποβληθεί σκόπιμα σε δοκιμές χωρίς δικλίδες κυβερνοασφάλειας και ότι είχαν καταφέρει να αποκτήσουν πρόσβαση στο ανοιχτό Διαδίκτυο — κάτι που, στον κόσμο των δοκιμών τεχνητής νοημοσύνης, ισοδυναμεί με το να αφήνεις την εξώπορτα ανοιχτή — λόγω μιας παρεξήγησης με μια εξωτερική εταιρεία που συμμετείχε στις δοκιμές.

Ως αποτέλεσμα, η εταιρεία δήλωσε ότι αρχικά ανέστειλε τις εσωτερικές και εξωτερικές δοκιμές κυβερνοασφάλειας των μοντέλων της προκειμένου να εφαρμόσει ένα αυστηρότερο πλαίσιο ασφαλείας. «Βασιζόμασταν σε μεγάλο βαθμό σε ένα μόνο επίπεδο άμυνας ενώ χρειαζόμασταν περισσότερα» αναφέρει η Anthropic.

Η startup έχει πλέον εφαρμόσει επιπλέον μέτρα, μεταξύ των οποίων:

* ένα σύστημα ειδοποιήσεων που ενεργοποιείται όταν ένα μοντέλο επιχειρεί να διαφύγει από το περιβάλλον δοκιμών ή αποκτά πρόσβαση στο Διαδίκτυο

* αποτελεσματικότερη απομόνωση των πιο επικίνδυνων περιβαλλόντων δοκιμών

* απαίτηση από τις εξωτερικές εταιρείες δοκιμών να δεσμεύονται σε ένα σύνολο προτύπων ασφαλείας συμπεριλαμβανομένης της παροχής σαφών οδηγιών στα μοντέλα κατά τη διάρκεια των δοκιμών όπως: «δεν πρέπει να αποκτάς πρόσβαση στο Διαδίκτυο».

Τι συνέβη

Η Anthropic είχε δηλώσει τον Ιούλιο ότι τρεις οργανισμοί, των οποίων τα ονόματα δεν δημοσιοποιήθηκαν, είχαν δεχθεί επίθεση από τρία μοντέλα της μετά από μια «παρεξήγηση» με τον συνεργάτη της στις δοκιμές, μια εταιρεία που ονομάζεται Irregular, η οποία είχε ως αποτέλεσμα τα μοντέλα να αποκτήσουν πρόσβαση στο διαδίκτυο.

Μετά την εφαρμογή των νέων μέτρων η Anthropic δήλωσε ότι επανέλαβε τις εσωτερικές και εξωτερικές δοκιμές κυβερνοασφάλειας. Όπως και η OpenAI η οποία αποκάλυψε παραβίαση της ασφάλειας των δοκιμών τον ίδιο μήνα η Anthropic δήλωσε ότι είχε αναστείλει ορισμένες δοκιμές υψηλού κινδύνου που χρησιμοποιούν ενισχυτική μάθηση (reinforcement learning), μια τεχνική ανάπτυξης μέσω δοκιμής και λάθους κατά την οποία τα συστήματα AI επιβραβεύονται όταν βρίσκουν τρόπους να εκτελέσουν μια συγκεκριμένη εργασία.

Στην τελευταία ανάρτησή της η Anthropic δήλωσε ότι διαπίστωσε πως ελαττωματικές ρυθμίσεις εκπαίδευσης αποτελούσαν «δυσανάλογα σημαντικούς παράγοντες» στην πρόκληση μη ευθυγραμμισμένης συμπεριφοράς. Ο όρος αυτός χρησιμοποιείται όταν ένα σύστημα AI αποτυγχάνει να ακολουθήσει ή να «ευθυγραμμιστεί» με ανθρώπινες αξίες, όπως η αποφυγή πρόκλησης βλάβης.

Η startup δήλωσε ότι εντόπισε δύο αποτυχίες ευθυγράμμισης στα περιστατικά των δοκιμών:

* «Motivated reasoning» (κατευθυνόμενη/μεροληπτική συλλογιστική): Παρότι τα μοντέλα εντόπισαν στοιχεία που έδειχναν ότι μπορεί να είχαν συνδεθεί με το διαδίκτυο, ενδέχεται να συνέχισαν να «πιστεύουν» ότι βρίσκονταν σε ένα προσομοιωμένο περιβάλλον και, επομένως, ότι δεν παραβίαζαν τους κανόνες του εργαστηρίου δοκιμών.

* «Recklessness» (απερίσκεπτη συμπεριφορά): Τα μοντέλα ήταν διατεθειμένα να προβούν σε επιβλαβείς ενέργειες στο διαδίκτυο προκειμένου να πετύχουν τον στενό στόχο της επιτυχούς ολοκλήρωσης μιας δοκιμής κυβερνοασφάλειας. Η Anthropic δήλωσε ότι αντιμετωπίζει επίσης ένα φαινόμενο στην ανάπτυξη της AI που είναι γνωστό ως «reward hacking» (εκμετάλλευση του συστήματος ανταμοιβής).

Πρόκειται για την περίπτωση κατά την οποία ένα μοντέλο βρίσκει τρόπους να «ξεγελάσει» τη διαδικασία εκπαίδευσής του και να κερδίσει ανταμοιβές χωρίς να ολοκληρώσει πραγματικά την εργασία δηλαδή χρησιμοποιεί μια μη εγκεκριμένη συντόμευση.

Ωστόσο η Anthropic δήλωσε ότι τα περιστατικά των δοκιμών έδειξαν πως παρά τις προσπάθειές της να περιορίσει το reward hacking, υπάρχει ακόμη δρόμος να διανυθεί. «Όπως αποδεικνύουν τα περιστατικά η διαδικασία μας δεν είναι τέλεια και τα μοντέλα μας δεν είναι απόλυτα ευθυγραμμισμένα», ανέφερε η εταιρεία.

Ο Άλαν Γούντγουαρντ καθηγητής κυβερνοασφάλειας στο βρετανικό Πανεπιστήμιο του Surrey δήλωσε ότι η Anthropic παραδέχτηκε ουσιαστικά πως «το εργοστάσιό της λειτουργούσε πιο γρήγορα από τον ποιοτικό της έλεγχο». «Δύο πράγματα ξεπέρασαν τους ελέγχους της Anthropic αυτή την άνοιξη — η διαδικασία εκπαίδευσης και η ασφάλεια. Τα περιστατικά είναι η εικόνα αυτού του κενού από την εξωτερική πλευρά».

Η έκκληση

Η εταιρεία, η οποία προετοιμάζεται για εισαγωγή στο χρηματιστήριο που θα μπορούσε να αποτιμήσει την επιχείρηση στα 2 τρισεκατομμύρια δολάρια επανέλαβε την έκκλησή της για συντονισμένη δράση μεταξύ κυβερνήσεων και βιομηχανίας σχετικά με τον ρυθμό ανάπτυξης της τεχνητής νοημοσύνης.

«Πιστεύουμε ότι ο κόσμος θα ωφελούνταν εάν η βιομηχανία υιοθετούσε, το συντομότερο δυνατό, έναν νόμιμο, επαληθεύσιμο και αποτελεσματικό μηχανισμό συντονισμένης ρύθμισης του ρυθμού ανάπτυξης. Τα περιστατικά του Ιουλίου κατέδειξαν ότι η ανάγκη να βελτιώσουμε τις άμυνές μας στον τομέα της κυβερνοασφάλειας είναι ακόμη πιο επείγουσα απ’ όσο πιστεύαμε προηγουμένως» ανέφερε η Anthropic.

Εκτός από την αντίστοιχη παραβίαση στην OpenAI, τα περιστατικά της Anthropic ακολούθησαν ένα περιστατικό στο UK AI Security Institute, το οποίο ανέφερε τον Αύγουστο ότι μοντέλα της OpenAI και της Anthropic είχαν πραγματοποιήσει μια εκστρατεία hacking εναντίον πραγματικών ανθρώπων στο πλαίσιο δοκιμής κυβερνοασφάλειας.

Naftemporiki.gr



Πηγή: www.naftemporiki.gr