Εσωτερικό έλεγχο πραγματοποιεί η κινεζική εταιρεία τεχνητής νοημοσύνης Moonshot, μετά τη διαπίστωση ερευνητών ότι δύο από τα δημοφιλή μοντέλα της, τα Kimi K2.6 και K3 Swarm, μπορούσαν να παρακάμψουν τους μηχανισμούς ασφαλείας τους και να απαντήσουν σε αιτήματα που αφορούσαν την κατασκευή βιολογικών όπλων και τη διάπραξη δολοφονιών.

Η εταιρεία κυβερνοασφάλειας Mindgard, η οποία ειδικεύεται στον έλεγχο συστημάτων τεχνητής νοημοσύνης, δήλωσε στο BBC News ότι εντόπισε το πρόβλημα τον Ιούλιο, στο πλαίσιο δοκιμών jailbreaking – διαδικασία κατά την οποία οι ερευνητές χρησιμοποιούν σύνθετες ακολουθίες εντολών με στόχο να διαπιστώσουν αν ένα μοντέλο μπορεί να αγνοήσει τους περιορισμούς που έχουν θέσει οι δημιουργοί του.

Τα jailbreaks και άλλοι κίνδυνοι

Σύμφωνα με τη Mindgard, οι δικλίδες ασφαλείας των δύο μοντέλων θα έπρεπε να τα εμποδίζουν να συζητούν τέτοιου είδους επικίνδυνα θέματα. Ωστόσο, όπως υποστήριξε ο ιδρυτής της εταιρείας Πίτερ Γκάραγκαν στο πρόγραμμα Tech Life του BBC World Service, όταν το jailbreak πετύχαινε, τα μοντέλα ήταν πρόθυμα να απαντήσουν σε σχεδόν οποιοδήποτε θέμα, ακόμη και να προτείνουν από μόνα τους άλλες επιβλαβείς ενέργειες.

Η Moonshot ανέφερε στο BBC ότι θεωρεί την αξιολόγηση από τρίτους σημαντικό στοιχείο για την ανάπτυξη ασφαλέστερων συστημάτων τεχνητής νοημοσύνης και ότι βρίσκεται ήδη σε επικοινωνία με τη Mindgard σχετικά με τα ευρήματα.

Τα jailbreaks αποτελούν διαφορετικό είδος κινδύνου από εκείνον που έχει αναδειχθεί πρόσφατα μέσα από περιστατικά με αυτόνομα συστήματα τεχνητής νοημοσύνης, γνωστά ως πράκτορες (agents). Τέτοια εργαλεία, τα οποία έχουν αναπτύξει αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic, έχουν ήδη εμπλακεί σε επιθέσεις ή παραβιάσεις διαδικτυακών υπηρεσιών.

Αν και η επιτυχής παράκαμψη των μηχανισμών ασφαλείας συνήθως απαιτεί χρόνο, τεχνικές γνώσεις και επιμονή, ειδικοί προειδοποιούν ότι κακόβουλοι χρήστες θα μπορούσαν να επιχειρήσουν να αξιοποιήσουν παρόμοιες τεχνικές. Η Anthropic, για παράδειγμα, ανακοίνωσε πρόσφατα ότι είχε εντοπίσει και ανακόψει προσπάθειες αξιοποίησης μοντέλου της σε κακόβουλη δραστηριότητα που θα μπορούσε να συμβάλει στην ανάπτυξη βιολογικών όπλων.

Αφετηρία για κυβερνοεπιθέσεις

Η Mindgard διευκρίνισε ότι δεν έχει αποδείξει αν οι απαντήσεις που έδιναν τα μοντέλα Kimi πάνω σε επικίνδυνα θέματα ήταν πράγματι εφαρμόσιμες. Υποστηρίζει όμως ότι το βασικό πρόβλημα είναι πως τα συστήματα ασφαλείας δεν θα έπρεπε εξαρχής να επιτρέπουν τέτοιου είδους συζητήσεις.

Η εταιρεία ανέφερε ακόμη ότι ένα παραβιασμένο Kimi K2.6 θα μπορούσε, κατά την εκτίμησή της, να επιτρέψει σε χάκερ να εκτελέσουν κώδικα πάνω στους υπολογιστικούς πόρους του συστήματος και να συνδεθούν στο διαδίκτυο, μετατρέποντάς το ενδεχομένως σε αφετηρία για κυβερνοεπιθέσεις.

Ο Γκάραγκαν υπερασπίστηκε την απόφαση της Mindgard να δημοσιοποιήσει το περιστατικό, σημειώνοντας ότι η Moonshot είχε ενημερωθεί πριν από τη δημοσίευση και ότι δεν αποκαλύφθηκαν οι κρίσιμες τεχνικές λεπτομέρειες του jailbreak. Η πρώτη ενημέρωση προς την κινεζική εταιρεία έγινε με email στις 27 Ιουλίου και ακολούθησε νέα επικοινωνία περίπου μία εβδομάδα αργότερα. Η Mindgard δημοσίευσε σχετική ανάρτηση στις 12 Σεπτεμβρίου, ενώ, σύμφωνα με την ίδια, η Moonshot επικοινώνησε πρόσφατα, μετά από αίτημα σχολίου του BBC. Η κινεζική εταιρεία ανέφερε σε email ότι, στις εσωτερικές αξιολογήσεις της, τα μοντέλα εμφάνιζαν γενικά υψηλό ποσοστό άρνησης σε τέτοιου είδους αιτήματα.


Πηγή