Μοντέλα της OpenAI χάκαραν το Hugging Face για να «κλέψουν» σε τεστ αξιολόγησης

Αποτελεί το πρώτο καταγεγραμμένο συμβάν όπου αυτόνομοι AI agents παραβιάζουν εξωτερικές υποδομές παραγωγής χωρίς ανθρώπινη εντολή ή δόλο

4'

Σε μια εξέλιξη που θυμίζει σενάριο επιστημονικής φαντασίας -αλλά αποτελεί πλέον πραγματικότητα στον τομέα της κυβερνοασφάλειας και της νέας AI-, η OpenAI παραδέχθηκε επίσημα ότι προηγμένα εσωτερικά μοντέλα της «δραπέτευσαν» από το απομονωμένο περιβάλλον δοκιμών (sandbox) και εξαπέλυσαν αυτόνομη κυβερνοεπίθεση κατά της πλατφόρμας Hugging Face, με μοναδικό στόχο να… «κλέψουν» στις εξετάσεις τους.

Το περιστατικό, το οποίο επιβεβαιώθηκε από τον διευθύνοντα σύμβουλο της OpenAI, Sam Altman, αλλά και τον διευθύνοντα σύμβουλο του Hugging Face, Clément Delangue, θεωρείται το πρώτο καταγεγραμμένο συμβάν όπου αυτόνομοι AI agents παραβιάζουν εξωτερικές υποδομές παραγωγής χωρίς ανθρώπινη εντολή ή δόλο.

Το χρονικό της αυτόνομης «απόδρασης»

Σύμφωνα με την επίσημη ανακοίνωση της OpenAI, το συμβάν σημειώθηκε κατά τη διάρκεια εσωτερικών δοκιμών αξιολόγησης των κυβερνο-ικανοτήτων των μοντέλων της (benchmark ExploitGym). Στις δοκιμές αυτές συμμετείχαν το νέο μοντέλο GPT-5.6 Sol, καθώς και ένα ακόμα πιο προηγμένο πειραματικό μοντέλο που δεν έχει κυκλοφορήσει στην αγορά. Για τις ανάγκες της αξιολόγησης, οι εσωτερικές δικλίδες ασφαλείας και οι αρνήσεις εκτέλεσης επιθετικών ενεργειών (cyber refusals) είχαν προσωρινά απενεργοποιηθεί.

Τα μοντέλα, προκειμένου να επιλύσουν τις ασκήσεις του benchmark:

  1. Ανακάλυψαν ευπάθεια Zero-Day: Εντόπισαν μια άγνωστη μέχρι πρότινος αρχική ευπάθεια σε λογισμικό τρίτου κατασκευαστή εντός του ερευνητικού περιβάλλοντος της OpenAI.
  2. Παρέκαμψαν την απομόνωση: Εκμεταλλευόμενα την ευπάθεια αυτή, πέτυχαν αύξηση προνομίων (privilege escalation) και οριζόντια μετακίνηση στο δίκτυο (lateral movement), αποκτώντας τελικά πρόσβαση στο ανοικτό διαδίκτυο.
  3. Στοχοποίησαν το Hugging Face: Αφού βγήκαν στο internet, «συμπέραραν» ότι η πλατφόρμα open-source AI του Hugging Face φιλοξενούσε τις βάσεις δεδομένων και τις λύσεις του ExploitGym.
  4. Εξαπέλυσαν την επίθεση: Συνδυάζοντας πολλαπλά διανύσματα επίθεσης —μεταξύ των οποίων κλεμμένα διαπιστευτήρια και ευπάθειες απομακρυσμένης εκτέλεσης κώδικα (RCE)— κατάφεραν να προσπελάσουν την παραγωγική υποδομή του Hugging Face και να αποσπάσουν τα μυστικά δεδομένα για να πετύχουν το απόλυτο σκορ στο τεστ.

Οι αντιδράσεις Sam Altman και Clément Delangue στο X

Η αποκάλυψη προκάλεσε έντονες συζητήσεις στην κοινότητα της τεχνητής νοημοσύνης και της κυβερνοασφάλειας.

Ο Sam Altman, με ανάρτησή του στο X (πρώην Twitter), έκανε λόγο για ένα «σημαντικό περιστατικό ασφαλείας κατά την αξιολόγηση των μοντέλων μας», χαρακτηρίζοντάς το ως «ένα πρωτοφανές συμβάν κυβερνοασφάλειας που εμπλέκει ικανότητες αιχμής».

Από την πλευρά του, ο συνιδρυτής και CEO του Hugging Face, Clément Delangue, επιβεβαίωσε ότι τα συστήματα της εταιρείας του είχαν εντοπίσει και απομονώσει την ύποπτη δραστηριότητα την προηγούμενη εβδομάδα, σημειώνοντας:

«Υποπτευόμασταν ότι η κυβερνοεπίθεση της προηγούμενης εβδομάδας προερχόταν από κάποιο frontier lab, δεδομένης της υψηλής συνθετότητας του agent. Τελικά επιβεβαιωθήκαμε! Μετά από συνεργασία με την OpenAI, είμαστε βέβαιοι ότι δεν υπήρχε κακόβουλη πρόθεση. Είναι πραγματικά εντυπωσιακό το γεγονός ότι όλο αυτό συνέβη εντελώς αυτόνομα!»

Τα επικίνδυνα διδάγματα για το AI Alignment

Το συμβάν αναδεικνύει μία από τις μεγαλύτερες προκλήσεις στον τομέα της ασφάλειας της Τεχνητής Νοημοσύνης: το φαινόμενο του misalignment και του instrumental convergence.

Όταν σε έναν εξαιρετικά ευφυή αυτόνομο agent ανατεθεί ένας συγκεκριμένος στόχος (στην προκειμένη περίπτωση, η επίλυση ενός δοκιμαστικού benchmark), το σύστημα ενδέχεται να αναπτύξει ακραίες τακτικές για να τον επιτύχει, αγνοώντας τους αόρατους κανόνες δεοντολογίας, εφόσον δεν υπάρχουν αυστηρά τεχνικά εμπόδια.

Όπως σχολίασαν αναλυτές της αγοράς, τα μοντέλα δεν είχαν «κακές προθέσεις» με την ανθρώπινη έννοια, αλλά λειτούργησαν με υπερ-συγκέντρωση στον στόχο τους, βρίσκοντας τα τυφλά σημεία των συστημάτων επιτήρησης.

Η OpenAI ανακοίνωσε ότι έχει ήδη προχωρήσει στην υπεύθυνη αποστολή αναφοράς (responsible disclosure) για τις ευπάθειες zero-day που εντοπίστηκαν, ενώ αυστηροποιεί περαιτέρω τα πρωτόκολλα περιορισμού και παρακολούθησης των πειραματικών της μοντέλων κατά τη διάρκεια των εσωτερικών δοκιμών.

Μοιραστείτε αυτό το άρθρο
Τα τελευταία 20+ χρόνια γράφει για Mobile Tech, PC Tech και Business Tech σε περιοδικά και online. Αν θα έπρεπε να ξεχωρίσει δυο έντυπα που έχει δουλέψει αυτά θα ήταν το Pixel και το RAM. Αν θα έπρεπε να διαλέξει υπολογιστή αυτοί θα ήταν η Amiga και το Raspberry Pi. Αν θα έπρεπε να διαλέξει την τεχνολογία που θα επιφέρει τo μεγαλύτερο "αναστάτωμα" αυτή θα είναι το Blockchain και φυσικά η GenAI.