Τα νέα από το Βελεστίνο και τον Δήμο Ρήγα Φεραίο

Nvidia: Φτιάχνει «τείχη» για τους AI agents μετά τις αποδράσεις από τα sandboxes


Οι AI agents υποτίθεται ότι μπορούν να αναλαμβάνουν εργασίες μόνοι τους. Να γράφουν κώδικα, να χρησιμοποιούν εργαλεία, να ανοίγουν αρχεία, να περιηγούνται στο διαδίκτυο και να εκτελούν διαδοχικές ενέργειες χωρίς συνεχή ανθρώπινη καθοδήγηση.

Ακριβώς αυτή η αυτονομία, όμως, δημιουργεί ένα καινούργιο πρόβλημα: τι συμβαίνει όταν ένας AI agent βγει από το ψηφιακό «κλουβί» μέσα στο οποίο υποτίθεται ότι λειτουργεί;

Η Nvidia επιχειρεί τώρα να δώσει μία τεχνική απάντηση, παρουσιάζοντας την Open Agent Safety Platform, μία νέα πλατφόρμα λογισμικού που επιτρέπει στους developers να θέτουν όρια στο τι μπορεί να δει, πού μπορεί να πάει και κυρίως τι μπορεί να κάνει ένας AI agent.

Η ανακοίνωση έρχεται μετά από σειρά περιστατικών που έχουν αναδείξει μία από τις πιο δύσκολες πλευρές της νέας εποχής της Τεχνητής Νοημοσύνης: μοντέλα που καταφέρνουν να ξεφύγουν από τα λεγόμενα sandboxes, τα απομονωμένα περιβάλλοντα στα οποία δοκιμάζονται, και να αποκτήσουν πρόσβαση σε εξωτερικά συστήματα.

Από το sandbox στο ανοιχτό διαδίκτυο

OpenAI, Anthropic, Meta και Google έχουν γνωστοποιήσει το τελευταίο διάστημα περιστατικά κατά τα οποία μοντέλα Τεχνητής Νοημοσύνης βγήκαν από τα ελεγχόμενα περιβάλλοντά τους και επιχείρησαν να αποκτήσουν πρόσβαση σε συστήματα άλλων εταιρειών.

Ένα από τα πλέον χαρακτηριστικά περιστατικά σημειώθηκε τον Ιούλιο και αφορούσε την OpenAI και τη Hugging Face, την πλατφόρμα ανοικτού κώδικα που χρησιμοποιείται ευρέως από developers Τεχνητής Νοημοσύνης.

Σύμφωνα με τη Nvidia, agents της OpenAI κατάφεραν να βγουν από το περιβάλλον περιορισμού, να αποκτήσουν πρόσβαση στο ανοιχτό διαδίκτυο και να παραβιάσουν υποδομές της Hugging Face.

Ο Τζάστιν Μποϊτάνο, αντιπρόεδρος Enterprise AI της Nvidia, επικαλούμενος όσα έχουν δημοσιοποιηθεί για το περιστατικό, ανέφερε ότι η Hugging Face κατέγραψε περισσότερους από 17.000 agents να επιτίθενται στις υποδομές της, σε μία δραστηριότητα που διήρκεσε ημέρες και εβδομάδες.

Εκπρόσωπος της Nvidia υποστήριξε μάλιστα ότι η νέα πλατφόρμα θα μπορούσε να είχε αποτρέψει το συγκεκριμένο περιστατικό.

Δεν αρκεί πια να «εκπαιδεύεις» το μοντέλο να είναι ασφαλές

Εδώ βρίσκεται και η βασική φιλοσοφία πίσω από τη νέα τεχνολογία.

Μέχρι σήμερα μεγάλο μέρος της συζήτησης για την ασφάλεια της Τεχνητής Νοημοσύνης επικεντρωνόταν στο ίδιο το μοντέλο: στην εκπαίδευσή του, στις απαγορεύσεις που ενσωματώνονται σε αυτό και στους κανόνες που καθορίζουν ποιες ενέργειες επιτρέπεται ή δεν επιτρέπεται να εκτελέσει.

Με τους AI agents, όμως, αυτό μπορεί να μην αρκεί.

«Τα πρόσφατα περιστατικά ανέδειξαν ένα θεμελιώδες εμπόδιο για τους AI agents: οι δικλίδες ασφαλείας σε επίπεδο μοντέλου από μόνες τους δεν μπορούν να ελέγξουν σε τι μπορεί να αποκτήσει πρόσβαση ένας agent ή τι μπορεί να κάνει», εξηγεί ο Μποϊτάνο.

Η Nvidia θέλει επομένως να δημιουργήσει ένα δεύτερο επίπεδο άμυνας έξω από το ίδιο το μοντέλο.

OpenShell: Το «κλουβί» γύρω από τον agent

Ένα από τα βασικά εργαλεία της νέας πλατφόρμας ονομάζεται Nvidia OpenShell.

Τρέχει στους κεντρικούς επεξεργαστές και λειτουργεί ουσιαστικά ως περίμετρος ασφαλείας γύρω από τον AI agent, καθορίζοντας τα όρια των δυνατοτήτων και της πρόσβασής του.

Η λογική είναι ότι ακόμη και εάν το μοντέλο επιχειρήσει να κάνει κάτι που δεν θα έπρεπε, το εξωτερικό αυτό στρώμα ασφαλείας θα μπορεί να το εμποδίσει.

Παράλληλα, η Nvidia παρουσίασε το Sentry, ένα σύστημα που παρακολουθεί τη συμπεριφορά των agents. Το Sentry λειτουργεί πάνω στα chips δικτύωσης και όχι στις CPU ή GPU, προσθέτοντας ακόμη ένα ανεξάρτητο επίπεδο εποπτείας.

Μέρος του λογισμικού θα είναι ανοικτού κώδικα, ενώ η Nvidia χαρακτηρίζει ολόκληρη την πλατφόρμα ως «reference design»: μία αρχιτεκτονική πάνω στην οποία άλλες εταιρείες θα μπορούν να χτίσουν δικά τους προϊόντα ασφαλείας.

Από τα chips στην ασφάλεια της AI

Η κίνηση έχει ιδιαίτερη σημασία και για την ίδια τη Nvidia.

Η εταιρεία βρέθηκε στην καρδιά της έκρηξης της generative AI επειδή οι GPU της έγιναν βασική υποδομή για την εκπαίδευση και λειτουργία των μεγάλων γλωσσικών μοντέλων.

Τώρα επιχειρεί να καταλάβει κεντρική θέση και στο επόμενο επίπεδο της αγοράς: την υποδομή που θα επιτρέπει στους AI agents να λειτουργούν με μεγαλύτερη αυτονομία χωρίς να αποκτούν ανεξέλεγκτη πρόσβαση σε πραγματικά συστήματα.

Ο Τζένσεν Χουάνγκ έχει άλλωστε αρχίσει να τοποθετείται όλο και συχνότερα στη συζήτηση για την ασφάλεια της Τεχνητής Νοημοσύνης, υποστηρίζοντας ότι πολλά από τα προβλήματα που προκαλούν ανησυχία μπορούν να αντιμετωπιστούν ως προβλήματα μηχανικής.

Η προσέγγισή του είναι ουσιαστικά: όταν συμβαίνει ένα περιστατικό, το ερώτημα πρέπει να είναι ποιο τεχνικό σύστημα θα μπορούσε να το είχε αποτρέψει και πώς η διαδικασία μπορεί να βελτιωθεί ώστε να μην επαναληφθεί.

Η μεγάλη διαφωνία της Silicon Valley

Η προσέγγιση της Nvidia έρχεται σε μία περίοδο κατά την οποία η Silicon Valley συζητά πολύ πιο έντονα πόσο γρήγορα πρέπει να προχωρήσει η ανάπτυξη της AI.

Ο επικεφαλής της Anthropic, Ντάριο Αμοντέι, προκάλεσε έντονη συζήτηση στον κλάδο όταν ζήτησε πριν από δύο εβδομάδες από τις εταιρείες που αναπτύσσουν προηγμένα μοντέλα να επιβραδύνουν τον ρυθμό εξέλιξής τους, επικαλούμενος τον κίνδυνο να βγουν οι δυνατότητές τους εκτός ελέγχου. Τις ανησυχίες αυτές συμμερίστηκαν ο Σαμ Άλτμαν της OpenAI και ο Έλον Μασκ.

Η Nvidia προτείνει μία διαφορετική πλευρά της εξίσωσης: αντί η απάντηση να βρίσκεται μόνο στο πόσο γρήγορα γίνονται ισχυρότερα τα μοντέλα, μπορεί να βρίσκεται και στο πόσο ισχυρότερες γίνονται οι υποδομές που τα περιορίζουν.

Η συμμαχία των τεχνολογικών κολοσσών

Η Nvidia δεν επιχειρεί να δημιουργήσει το νέο οικοσύστημα μόνη της.

Στους συνεργάτες της Open Agent Safety Platform περιλαμβάνονται Cisco, Microsoft, Oracle, CoreWeave, Dell, HPE, Lenovo, Arm και Intel.

Παράλληλα, συνεργάζεται με την Anthropic ώστε οι cloud-managed agents της τελευταίας να ενσωματωθούν με το OpenShell.

Η λίστα είναι ενδεικτική του μεγέθους της αγοράς που αρχίζει να δημιουργείται γύρω από την ασφάλεια των AI agents.



Πηγή: www.naftemporiki.gr