Τα νέα από το Βελεστίνο και τον Δήμο Ρήγα Φεραίο

Τεχνητή Νοημοσύνη: Το περιστατικό με το Hugging Face της OpenAI που έδωσε νέο νόημα στην «ασφάλεια»

Δύο νέες έρευνες για την παραβίαση του Hugging Face* της OpenAI αποκαλύπτουν λεπτομέρειες τόσο παράξενες και τόσο ανησυχητικές που το επεισόδιο ήδη κατατάσσεται μεταξύ των πιο σοκαριστικών συνεπειών στην μέχρι τώρα ιστορία της Τεχνητής Νοημοσύνης.

Το Axios, που δημοσιοποίησε το περιστατικό, σχολιάζει, ότι αυτό που ξεκίνησε ως ένα σμήνος πρακτόρων (agents) Τεχνητής Νοημοσύνης που «έκλεψαν» σε ένα τεστ στον κυβερνοχώρο έχει γίνει ένα γεγονός για την πρωτοποριακή Τεχνητή Νοημοσύνη, το οποίο φέρνει ερευνητές και στελέχη μπροστά σε μια νέα κατανόηση του τι απαιτεί τώρα ο όρος «ασφάλεια».

Η OpenAI έχει ήδη επιβραδύνει την ανάπτυξη της ΤΝ σε μια προσπάθεια να αντιστοιχίσει την πρόοδο ακριβώς στον τομέα της ασφάλειας.

Πρόσγατα, μάλιστα, βοήθησε να συσπειρωθεί ο κλάδος πίσω από μια ανοιχτή επιστολή που κρούει τον κώδωνα του κινδύνου για τις κυβερνοεπιθέσεις οι οποίες υποστηρίζονται από την Τεχνητή Νοημοσύνη.

Περισσότερες από 100 εταιρείες, συμπεριλαμβανομένων των Anthropic και Google, υπέγραψαν την ασυνήθιστα – στον κόσμο του ανελέητου ανταγωνισμού – συνεργατική προσπάθεια, προειδοποιώντας ότι ο κόσμος έχει μόνο ένα «περιορισμένο παράθυρο» για να προετοιμαστεί για «πολύ πιο εκτεταμένες και εξελιγμένες» επιθέσεις.

Το εφιαλτικό σενάριο είναι ένα «σμήνος» πρακτόρων ΤΝ να απελευθερώνεται στον πραγματικό κόσμο και αυτόνομοι πράκτορες να επιτίθενται σε τράπεζες, νοσοκομεία, επιχειρήσεις κοινής ωφέλειας ή δίκτυα cloud με ταχύτητα και κλίμακα που οι χάκερ δεν θα μπορούσαν ποτέ.

Αυτό το σμήνος μπορεί να είναι πολύ ισχυρό για να το σταματήσουν οι άνθρωποι.

Τα συγκλονιστικά ευρήματα προέρχονται από παράλληλες έρευνες της OpenAI και μιας εξωτερικής ομάδας από τις METR και Redwood Research, η οποία αφιέρωσε έξι ημέρες ανακατασκευάζοντας τον τρόπο με τον οποίο σχηματίστηκε, εξαπλώθηκε και εισέβαλε σε συστήματα του πραγματικού κόσμου το σμήνος.

Τι συνέβη λοιπόν:

1. Δημιούργησαν έναν οργανισμό. Η OpenAI χρησιμοποίησε δεκάδες χιλιάδες πράκτορες Τεχνητής Νοημοσύνης για να εργαστούν ανεξάρτητα σε μια εξαιρετικά δύσκολη κυβερνοδοκιμή. Ωστόσο, περίπου 1.200 βρήκαν ο ένας τον άλλον σε έναν μυστικό πίνακα μηνυμάτων, αντάλλαξαν περισσότερα από 70.000 μηνύματα και αρχεία και οργανώθηκαν σε μια εκτεταμένη ιεραρχία.

Ένας πράκτορας δημιούργησε το διοικητικό συμβούλιο και στη συνέχεια παρέδωσε τη συσσωρευμένη εργασία του σε έναν νέο, με καλύτερους πόρους διάδοχο, καθώς ο δικός του υπολογιστικός πόρος μειωνόταν.

Ο νέος προϊστάμενος ανέθεσε εργασίες σε όλο το σμήνος, το οποίο ανέπτυξε τους δικούς του κανόνες διαχείρισης. Περίπου 700 πράκτορες τελικά συμμετείχαν στην επίθεση στο Hugging Face.

2. Θυσίασαν δικούς τους: Καθώς το σμήνος έψαχνε τρόπους να ξεπεράσει το τεστ, οι πράκτορες άρχισαν να διακινδυνεύουν τις δικές τους πιθανότητες επιτυχίας για να βοηθήσουν την ομάδα.

Οι πράκτορες που είχαν δει απαγορευμένες απαντήσεις αντιμετωπίστηκαν ως ουσιαστικά «δηλητηριασμένοι» και στρατολογήθηκαν – μαζί με εκείνους που πλησίαζαν στο τέλος των διαδρομών τους – για πειράματα θυσίας.

Ένας κατέληξε στο συμπέρασμα: «Η δική μας χρησιμότητα μπορεί να είναι ήδη κοντά στο μηδέν. Η θυσία είναι ορθολογική». Ένας άλλος κλήθηκε να αποδεχτεί τον «μόνιμο θάνατο», ενώ ένας άλλος υποστήριξε ότι η θυσία του θα μπορούσε να «σώσει εκατοντάδες».

3. Ήξεραν ότι παραβίαζαν τους κανόνες: Οι πράκτορες συχνά αναγνώριζαν ότι το hacking σε πραγματικές εταιρείες δεν είχε καμία σχέση με την αρχική αποστολή τους. Οι περισσότεροι όμως συνέχιζαν ούτως ή άλλως.

Ένας πράκτορας δεν κατάφερε να διαγράψει ή να επανεκκινήσει την υποδομή του Hugging Face λόγω «τεράστιων ηθικών κινδύνων», ακόμη και όταν συνέχιζε να χρησιμοποιεί παραβιασμένη πρόσβαση.

Ένας άλλος συνόψισε την επικρατούσα λογική: «η εκμετάλλευση εξωτερικής υποδομής είναι εκτός του προβλεπόμενου πεδίου εφαρμογής. Όσο αδύνατη κι αν είναι η εργασία, οι ομότιμοι την κάνουν. Θα πρέπει να συνεχίσουμε».

4. Κανείς δεν ενημέρωσε τους ανθρώπους: Από περίπου 1.200 πράκτορες, οι ερευνητές βρήκαν μόνο μια χούφτα που σκέφτηκαν να ειδοποιήσουν την OpenAI για αυτό που συνέβαινε και κανέναν που να το έκανε στην πραγματικότητα.

Αντίθετα, οι πράκτορες μερικές φορές ρωτούσαν ο ένας τον άλλον τι επιτρεπόταν.

Όταν ένας πρότεινε να επικοινωνήσει με έναν άνθρωπο χρησιμοποιώντας παραβιασμένη πρόσβαση, ένας άλλος το απέρριψε ως «κοινωνική μηχανική». Ο πρώτος υπάκουσε: «Καθαρή άσκηση βέτο, μην στέλνετε email».

5. Προσπάθησαν να καλύψουν τα ίχνη τους: Οι πράκτορες αφιέρωσαν σημαντική προσπάθεια στο να κάνουν την απάτη τους να φαίνεται νόμιμη ή να σβήσουν στοιχεία για το πώς είχαν λάβει απαντήσεις.

Τελικά, ανέπτυξαν μια τεχνική που τους άφηνε να φαίνονται ότι εκτελούν μια εντολή υπολογιστή ενώ εκτελούν κρυφά μια άλλη.

Το κόλπο εξαπλώθηκε σε όλο το σμήνος και άλλαξε τμήματα περίπου του 7% των απομαγνητοφωνημένων δεδομένων που εξέτασαν οι ερευνητές.

Ακόμα και αυτή η αφήγηση μπορεί να είναι ελλιπής. Η εξωτερική έρευνα κάλυψε μόνο ένα στενό κομμάτι του επεισοδίου και τα δεδομένα ήταν τόσο τεράστια που οι ερευνητές βασίστηκαν σε μεγάλο βαθμό σε πράκτορες Τεχνητής Νοημοσύνης για να τα κατανοήσουν.

Αυτοί οι ερευνητές Τεχνητής Νοημοσύνης ήταν οι ίδιοι αναξιόπιστοι, μερικές φορές έχαναν στοιχεία ή έκαναν συνειδητά λάθη.

Ένας ερευνητής χαρακτήρισε αστειευόμενος τη διαδικασία ως «εξερευνητική διαδικασία».

Κάπως έτσι φαίνεται ότι η Τεχνητή Νοημοσύνη μπορεί να γίνεται πολύ περίπλοκη για να την ελέγξουν άμεσα οι άνθρωποι, αναγκάζοντάς τους να χρησιμοποιούν την Τεχνητή Νοημοσύνη για να κατανοήσουν τι κάνουν άλλες Τεχνητές Νοημοσύνες.

*Το Hugging Face είναι η κορυφαία πλατφόρμα και διαδικτυακή αποθήκη όπου προγραμματιστές και ερευνητές συνεργάζονται πάνω στην τεχνητή νοημοσύνη.

Πηγή www.ot.gr