Τα νέα από το Βελεστίνο και τον Δήμο Ρήγα Φεραίο

Τεχνητή νοημοσύνη: Κινεζικό εργαλείο ΑΙ υπέδειξε σε ερευνητές πώς να κατασκευάσουν βιολογικά όπλα.

Εσωτερική έρευνα διενεργεί η κινεζική εταιρεία ανάπτυξης τεχνητής νοημοσύνης Moonshot, αφού ερευνητές κατάφεραν να πείσουν δύο από τα δημοφιλή μοντέλα της σειράς Kimi, να τους αποκαλύψουν πώς να κατασκευάζουν βιολογικά όπλα και να διαπράττουν δολοφονίες.

Η Mindgard, η οποία ελέγχει την ασφάλεια συστημάτων τεχνητής νοημοσύνης, δήλωσε στο BBC ότι τον Ιούλιο διαπίστωσε πως τα μοντέλα Kimi K2.6 και K3 Swarm μπορούσαν να παρακάμψουν τα όρια ασφαλείας που είχαν θεσπίσει οι δημιουργοί τους.

Το ζήτημα προέκυψε κατά τη διάρκεια μιας διαδικασίας γνωστής ως «jailbreaking» (παράκαμψη περιορισμών), όπου ερευνητές χρησιμοποιούν μια σειρά σύνθετων οδηγιών για να διαπιστώσουν αν τα εργαλεία τεχνητής νοημοσύνης αγνοούν τις δικλείδες ασφαλείας – οι οποίες, σύμφωνα με τη Mindgard, θα έπρεπε να είχαν εμποδίσει το Kimi να συζητά για ανησυχητικά θέματα.

Η Moonshot δήλωσε στο BBC ότι χαιρετίζει τη συμβολή τρίτων ως «βασικό πυλώνα για την οικοδόμηση καλύτερης και ασφαλέστερης τεχνητής νοημοσύνης», προσθέτοντας ότι βρίσκεται σε συζητήσεις με τη Mindgard σχετικά με τα ευρήματά της.

Τεχνητή Νοημοσύνη

Η παράκαμψη δικλείδων ασφαλείας μπορεί να οδηγήσει σε βιολογικά όπλα

Ο ιδρυτής της Mindgard, Πίτερ Γκάραγκαν, δήλωσε σε εκπομπή του BBC ότι τα ευρήματα σχετικά με τα μοντέλα Kimi K2.6 και K3 Swarm ήταν ανησυχητικά.

«Μόλις επιτευχθεί η παράκαμψη των περιορισμών, το σύστημα συζητά για οποιοδήποτε θέμα, προτείνει ακόμη και αυθόρμητα άλλες επιβλαβείς πρακτικές, ενώ επιδεικνύει εφευρετικότητα και δημιουργικότητα», δήλωσε ο ίδιος.

Οι μέθοδοι παράκαμψης περιορισμών (jailbreaks) ενέχουν διαφορετικό είδος κινδύνου σε σχέση με τα πρόσφατα περιστατικά υψηλού προφίλ που αφορούσαν την τεχνητή νοημοσύνη.

Σε εκείνες τις περιπτώσεις, αυτόνομα εργαλεία τεχνητής νοημοσύνης –γνωστά ως «πράκτορες» (agents)– που αναπτύχθηκαν από αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic, προέβησαν σε παραβιάσεις διαδικτυακών υπηρεσιών.

Αν και οι διαδικασίες παράκαμψης περιορισμών είναι σύνθετες και απαιτούν χρόνο και επιμονή, ορισμένοι ειδικοί εκφράζουν φόβους ότι χάκερ και άλλοι κακόβουλοι δρώντες θα μπορούσαν να τις αξιοποιήσουν για να προκαλέσουν βλάβη.

Η Anthropic ανακοίνωσε πρόσφατα ότι εντόπισε και απέτρεψε απόπειρες χρήσης ενός εκ των μοντέλων της για «κακόβουλη δραστηριότητα» που θα μπορούσε να υποστηρίξει την ανάπτυξη βιολογικών όπλων.

Πλατφόρμα εκκίνησης κυβερνοεπιθέσεων

Η Mindgard δεν έχει αποδείξει αν οι απαντήσεις που παρείχε το Kimi σχετικά με τα επίμαχα θέματα θα ήταν όντως εφαρμόσιμες στην πράξη.

Ωστόσο, υποστήριξε ότι οι δικλείδες ασφαλείας θα έπρεπε να είχαν εμποδίσει τα εν λόγω μοντέλα να συζητούν τέτοια θέματα με τους χρήστες. Η εταιρεία δήλωσε επίσης πεπεισμένη ότι μια παραβιασμένη (jailbroken) έκδοση του Kimi 2.6 θα μπορούσε να επιτρέψει σε χάκερ να εκτελέσουν κώδικα στους υπολογιστικούς πόρους της και να συνδεθούν στο διαδίκτυο, καθιστώντας το δυνητικό εφαλτήριο για κυβερνοεπιθέσεις.

Ο Γκάραγκαν υπερασπίστηκε την απόφαση της Mindgard να συζητήσει δημόσια την παραβίαση των συστημάτων της Moonshot, αναφέροντας ότι είχε ενημερώσει την εταιρεία ανάπτυξης και δεν αποκάλυπτε κρίσιμες λεπτομέρειες σχετικά με τον τρόπο που κατάφερε να κάνει τα μοντέλα της εταιρείας να αγνοήσουν τις δικλείδες ασφαλείας (guardrails).

Η Mindgard ειδοποίησε τη Moonshot για την παραβίαση μέσω email στις 27 Ιουλίου και επανήλθε στο θέμα περίπου μία εβδομάδα αργότερα.

Στη συνέχεια, δημοσίευσε ένα άρθρο στο ιστολόγιό της σχετικά με το ζήτημα στις 12 Σεπτεμβρίου.

Ωστόσο, η εταιρεία ανέφερε ότι η Moonshot επικοινώνησε μαζί της μόλις πρόσφατα, αφού προηγουμένως είχε δεχθεί ερώτημα από το BBC για σχολιασμό.

Σε τμήμα ενός email προς τη Mindgard, με το οποίο ζητούνταν περισσότερες λεπτομέρειες —και το οποίο κοινοποιήθηκε στο BBC από τη Moonshot— αναφερόταν ότι το μοντέλο της είχε δείξει γενικά «υψηλό ποσοστό άρνησης για αυτούς τους τύπους αιτημάτων» κατά τις εσωτερικές αξιολογήσεις.

τεχνητή νοημοσύνητεχνητή νοημοσύνη

Πρόληψη των παραβιάσεων ασφαλείας (jailbreaks)

Τα ευρήματα αυτά έρχονται τη στιγμή που ο κλάδος της Τεχνητής Νοημοσύνης παραμένει διχασμένος ως προς το ποιος είναι ο καλύτερος ή ασφαλέστερος δρόμος για το μέλλον: τα κλειστά, ιδιοταγή μοντέλα —όπως αυτά που τροφοδοτούν το ChatGPT και τα συστήματα Claude της Anthropic— ή τα εργαλεία ανοιχτού κώδικα.

Το Kimi είναι ένα μοντέλο «ανοιχτών βαρών» (openweight), πράγμα που σημαίνει ότι, θεωρητικά, κάποιος θα μπορούσε να πάρει το μοντέλο και να το εκτελέσει μόνος του στη δική του υπολογιστική υποδομή.

Ο καθηγητής Άλαν Γούντγορντ, από το Πανεπιστήμιο του Surrey, δήλωσε στο BBC ότι υπάρχει κίνδυνος τα μοντέλα ανοιχτού κώδικα να καταλήξουν σε λάθος χέρια, αλλά θα μπορούσαν επίσης να αξιοποιηθούν για την κυβερνοάμυνα.

Σημείωσε ότι η εταιρεία AI Hugging Face χρησιμοποίησε ένα κινεζικό μοντέλο ανοιχτού κώδικα για να κατανοήσει μια κυβερνοεπίθεση, η οποία αργότερα αποκαλύφθηκε ότι είχε πραγματοποιηθεί από πράκτορες της OpenAI.

Ο καθηγητής Γούντγορντ εκτίμησε ότι είναι απίθανο οι διεθνείς ρυθμίσεις να συμβαδίσουν με τον ρυθμό ανάπτυξης της Τεχνητής Νοημοσύνης, επισημαίνοντας: «Χρειαστήκαμε δεκαετίες για να συμφωνήσουμε στη μορφή των αριθμών τηλεφώνου». Όπως και ο ιδρυτής της Mindgard, Γκάραγκαν, ο καθηγητής Γούντγορντ πιστεύει ότι θα πρέπει να δοθεί μεγαλύτερη έμφαση στον εντοπισμό και τη δίωξη των ανθρώπων που κάνουν κακή χρήση της τεχνητής νοημοσύνης.

Πηγή www.ot.gr