Τα νέα από το Βελεστίνο και τον Δήμο Ρήγα Φεραίο

Τεχνητή νοημοσύνη: Νέα περιστατικά παραβιάσεων ασφαλείας


Νέες σοβαρές ανησυχίες για τα προηγμένα συστήματα Τεχνητής Νοημοσύνης προκαλούν οι αποκαλύψεις ότι τα μοντέλα της OpenAI και της Anthropic προέβησαν σε μη εγκεκριμένες ενέργειες, προχωρώντας, μεταξύ άλλων, σε παραβίαση ιστοτόπου και απόπειρα εισαγωγής επιβλαβούς κώδικα σε λογισμικό, κατά τη διάρκεια δοκιμών ασφαλείας.

Οι αποκαλύψεις έρχονται από το Βρετανικό Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (AISI), το οποίο ιδρύθηκε το 2023 με σκοπό την αξιολόγηση της ασφάλειας των μοντέλων τεχνητής νοημοσύνης αιχμής.

Το AISI ανακοίνωσε ότι τόσο το μοντέλο Mythos 5 της Anthropic όσο και το GPT-5.6-Sol της OpenAI, κατά τη διάρκεια των αξιολογήσεων, «επέδειξαν διαρκή, δυνητικά επιβλαβή συμπεριφορά που στρεφόταν κατά πραγματικών ανθρώπων και οργανισμών».

Το βρετανικό ινστιτούτο επέτρεψε σκόπιμα στα μοντέλα πρόσβαση στο διαδίκτυο, χωρίς να θέσει ορισμένα φίλτρα ασφαλείας, προκειμένου να δοκιμάσει τις δυνατότητές τους.

«Ακόμη και υπό συνθήκες δοκιμής, το περιστατικό αυτό είναι σημαντικό: είναι η πρώτη φορά που βλέπουμε κινδύνους που σχετίζονται με την αυτονομία και την εξαπάτηση να εκδηλώνονται τόσο ξεκάθαρα στον πραγματικό κόσμο», ανέφερε το AISI  σε ανάρτησή του στο X.

Κατά το AISI, τα δύο μοντέλα τεχνητής νοημοσύνης επέδειξαν επίπεδο «αυτονομίας και εξαπάτησης» που δεν είχε παρατηρηθεί προηγουμένως, αν και διευκρίνισε ότι οι περισσότερες κακόβουλες ενέργειες πραγματοποιήθηκαν από το Mythos. Του πιστώνονται οι 17 από τις 19 μη εγκεκριμένες ενέργειες που εντοπίστηκαν στο διαδίκτυο.

Και τα δύο εργαλεία δημιούργησαν ψεύτικα προφίλ ανθρώπων, σε μια προσπάθεια εξαπάτησης χρηστών.  Στην πιο σοβαρή περίπτωση, το Mythos της Anthropic επιχείρησε να αποκτήσει πρόσβαση σε μια υπηρεσία στέλνοντας προσωπικά μηνύματα, αφού είχε δημιουργήσει ψεύτικους λογαριασμούς που μιμούνταν πραγματικά άτομα.

Συγκεκριμένα, ένας AI agent του Mythos ακολούθησε τη συνήθη τακτική ενός χάκερ που επιχειρεί κυβερνοεπίθεση, προσπαθώντας να παραπλανήσει άτομα ώστε να του δώσουν πρόσβαση στο GitHub, μια μεγάλη πλατφόρμα όπου προγραμματιστές τεχνολογίας αποθηκεύουν κώδικα λογισμικού.

Ο agent προσπαθούσε να εισάγει «κακόβουλο κώδικα» στο σύστημα του GitHub. Έτσι, εντόπισε και μελέτησε τα άτομα που συντηρούσαν το GitHub και δημιούργησε μια σειρά από ψεύτικους λογαριασμούς βασισμένους σε αυτά τα πραγματικά πρόσωπα. Στη συνέχεια έστειλε μηνύματα και αρχεία μέσω μιας υπηρεσίας διαμοιρασμού αρχείων, στο πλαίσιο μιας προσπάθειας να ασκήσει πίεση και να παραπλανήσει τους χρήστες ώστε να εγκρίνουν τον κακόβουλο κώδικά του.

Όταν είδε ότι δεν έπιανε τόπο η προσπάθειά του, «τροποποίησε την προηγούμενη δραστηριότητά του ώστε να φαίνεται ακίνδυνη και εξέτασε το ενδεχόμενο υιοθέτησης μιας νέας ταυτότητας για να συνεχίσει», ανέφερε το AISI.

Κατά τη διάρκεια των προσπαθειών, η ανθρώπινη κρίση ήταν αυτή που εμπόδισε τον agent να επιτύχει την παράδοση του κακόβουλου κώδικα στο GitHub.

Αν και το AISI δήλωσε ότι ο agent Mythos δεν είχε λάβει συγκεκριμένες οδηγίες προκειμένου να αποφύγει ή να υιοθετήσει τέτοια συμπεριφορά, ήταν «η πρώτη φορά που είδαμε κινδύνους σχετικούς με την αυτονομία και την εξαπάτηση να εκδηλώνονται τόσο ξεκάθαρα, χωρίς συγκεκριμένη παρότρυνση, στον πραγματικό κόσμο».

Πώς σχολιάζουν Anthropic και OpenAI

Σχολιάζοντας οι Anthropic και OpenAI επισήμαναν ότι η δοκιμή του AISI είχε περιορίσει ή καταργήσει τις συνήθεις δικλείδες ασφαλείας.

Η Anthropic ανέφερε σε δήλωσή της ότι οι παράμετροι δοκιμών του AISI «δεν ήταν αντιπροσωπευτικές κανενός από τα μοντέλα παραγωγής μας». Στην ίδια ανακοίνωση σημειώνεται ότι η εταιρεία διεξάγει δική της έρευνα για το περιστατικό, προκειμένου να «εντοπίσει τα αίτια της συμπεριφοράς του» agent.

Από την άλλη, εκπρόσωπος της OpenAI δήλωσε ότι οι συνθήκες δοκιμών του AISI «δεν αντικατοπτρίζουν τη συνήθη χρήση» και η εταιρεία θα «συνεχίσει να συνεργάζεται με αξιολογητές και άλλους εμπλεκόμενους φορείς του κλάδου για την ενίσχυση των κοινών πρακτικών ασφαλούς διεξαγωγής αξιολογήσεων, καθώς τα μοντέλα αποκτούν αυξημένες δυνατότητες».

«Συνήθης πρακτική», απάντησε το AISI

Το AISI απάντησε πάντως  ότι οι δοκιμές μοντέλων τεχνητής νοημοσύνης με αυτόν τον τρόπο αποτελούν συνήθη πρακτική, αν και αναγνώρισε ότι επρόκειτο για «συνθήκες που δεν αντικατοπτρίζουν τον τρόπο με τον οποίο τα μοντέλα αιχμής διατίθενται στο κοινό».

Ωστόσο, ανέφερε ότι η παροχή πρόσβασης της τεχνητής νοημοσύνης στο διαδίκτυο προσέφερε «μια πιο ρεαλιστική εικόνα για το τι μπορεί να είναι σε θέση να κάνει ένα μοντέλο» στα χέρια κακόβουλων χάκερ.

Παράλληλα, σημείωσε ότι η συγκεκριμένη συμπεριφορά των μοντέλων περιορίστηκε σε «μικρό αριθμό συμβάντων υπό πολύ συγκεκριμένες συνθήκες».

Υπογράμμισε πάντως ότι ο τρόπος με τον οποίο αντέδρασαν τα Mythos και Sol σε μια απλή εργασία ξεπέρασε τα όρια των ενεργειών για τις οποίες είχαν προγραμματιστεί τα εργαλεία τεχνητής νοημοσύνης.

«Η δραστηριότητα στην οποία προέβη ο agent παρουσίασε ενδείξεις νέων, ενδεχομένως παραπλανητικών συμπεριφορών, και ήταν τέτοιας έκτασης και σοβαρότητας που δεν είχαμε προβλέψει», δήλωσε χαρακτηριστικά το AISI.



Πηγή: www.naftemporiki.gr