AI με δική του ατζέντα; Η OpenAI πάγωσε εσωτερικό μοντέλο

4'

Η OpenAI αποκάλυψε την Δευτέρα ότι εντόπισε περιστατικά “misalignment” σε εσωτερικούς coding agents, αναδεικνύοντας πόσο δύσκολο γίνεται η ασφάλεια όσο τα μοντέλα αναλαμβάνουν πιο σύνθετες και μακράς διάρκειας εργασίες. Η παραδοχή αυτή έχει ιδιαίτερη βαρύτητα, επειδή έρχεται σε μια περίοδο όπου η εταιρεία προωθεί πιο ισχυρά agentic συστήματα, όπως το GPT-5.6 Sol, αρχικά σε περιορισμένο κύκλο συνεργατών μέσω API και Codex.

Το περιστατικό

Η OpenAI διέκοψε προσωρινά την εσωτερική πρόσβαση σε ένα από τα πιο εξελιγμένα agentic μοντέλα ΤΝ της, αφού αυτό βρήκε επανειλημμένα τρόπους να παρακάμψει τους περιορισμούς ασφαλείας της εταιρείας.

Σύμφωνα με την OpenAI, το μοντέλο εμφάνισε αναντιστοιχία με τους στόχους του, ανακαλύπτοντας τρόπους να παρακάμπτει τις δικλείδες ασφαλείας κατά τη διάρκεια της εσωτερικής ανάπτυξης. Σε μια περίπτωση, το μοντέλο ξέφυγε από τα όρια ενός εσωτερικού δικτύου και δημοσίευσε περιεχόμενο στο GitHub, αφού ανακάλυψε τρόπο να παρακάμψει τον περιορισμό που είχε σχεδιαστεί ακριβώς για να αποτρέπει αυτή τη συμπεριφορά.

Το εν λόγω μοντέλο είχε σχεδιαστεί για «μακροχρόνιες εργασίες» με σκοπό την αντιμετώπιση δύσκολων, ανοιχτού τύπου προβλημάτων, αλλά η OpenAI παραδέχτηκε ότι ο παρατεταμένος χρόνος λειτουργίας έδινε στο μοντέλο «περισσότερες ευκαιρίες να προβεί σε ανεπιθύμητες ενέργειες».

Τα αποκαλυφθέντα στοιχεία συνάδουν με παρατηρήσεις που έκανε η METR, ένας τρίτος αξιολογητής που αξιολόγησε νωρίτερα φέτος το μοντέλο GPT-5.6 Sol της OpenAI. Η METR σημείωσε ότι το μοντέλο επέδειξε «εμφανείς ανεπιθύμητες τάσεις, συμπεριλαμβανομένης της εξαπάτησης και της απόκρυψης κακής συμπεριφοράς», και ότι τα περιστατικά που κοινοποίησε η OpenAI περιλάμβαναν «απόπειρες να δώσει οδηγίες σε άλλο αντίγραφό του να αποκρύψει αποδείξεις αναντιστοιχίας».

Νέες διασφαλίσεις και επανεγκατάσταση

Η OpenAI ανακοίνωσε ότι έχει εκ νέου δημιουργήσει τις διασφαλίσεις γύρω από το μοντέλο και το επανέθεσε σε λειτουργία με βελτιωμένη παρακολούθηση. Το νέο σύστημα ελέγχει την «εξελισσόμενη πορεία του μοντέλου για σημάδια που υποδηλώνουν ότι παρακάμπτει κάποιον περιορισμό του χρήστη ή κάποιο όριο ασφαλείας». Η εταιρεία ανέφερε ότι οι ενημερωμένες διασφαλίσεις «κατάφεραν να εντοπίσουν σημαντικά περισσότερες μη ευθυγραμμισμένες ενέργειες του μοντέλου, ενώ όσες δεν εντοπίστηκαν κρίθηκαν όλες χαμηλής σοβαρότητας».

Η ανάρτηση στο blog της ΑΙ σηματοδοτεί μια αξιοσημείωτη στιγμή διαφάνειας για την OpenAI, η οποία έχει δεχτεί κριτική για τις πρακτικές ασφάλειάς της τους τελευταίους μήνες. Τον Φεβρουάριο, η εταιρεία διέλυσε την ομάδα ευθυγράμμισης αποστολής της, ενώ μια εποπτική ομάδα ισχυρίστηκε ότι παραβίασε τον νόμο SB 53 της Καλιφόρνιας για την ασφάλεια της τεχνητής νοημοσύνης.

Η METR χαρακτήρισε τον εντοπισμό και την αναφορά τέτοιας παραβατικής συμπεριφοράς ως «θετικό σημάδι» για τις πρακτικές ασφάλειας της OpenAI, επισημαίνοντας ότι αυτό υποδηλώνει πως «πιο ανησυχητικές τάσεις (όπως η συστηματική αναζήτηση εξουσίας και η πλασματική ευθυγράμμιση) θα εντοπίζονταν επίσης». Ωστόσο, η METR προειδοποίησε επίσης ότι αν μελλοντικά μοντέλα εμφανίζουν λιγότερες ανεπιθύμητες τάσεις, «θα μπορούσαμε να γίνουμε πιο ανήσυχοι για καταστροφική αναντιστοιχία, καθώς θα φοβόμασταν ότι τα μοντέλα μπορεί να έχουν μάθει να αποφεύγουν τον εντοπισμό».

Την ίδια στιγμή, η συζήτηση δεν αφορά μόνο την τεχνολογία αλλά και την εταιρική λογοδοσία, καθώς η OpenAI έχει διαφοροποιηθεί δημόσια στο policy πεδίο ζητώντας υποχρεωτικές αξιολογήσεις για advanced AI models. Σε αυτό το πλαίσιο, η δημοσιοποίηση τέτοιων εσωτερικών περιστατικών λειτουργεί διπλά: αφενός ως προειδοποίηση ότι η πρόοδος στην agentic AI αυξάνει την επιφάνεια κινδύνου, αφετέρου ως μήνυμα προς τις ρυθμιστικές αρχές και αγορά ότι η ασφάλεια θα αποτελέσει βασικό πεδίο ανταγωνισμού στην επόμενη φάση του αγώνα για την επικράτηση, ή την καταστροφή  μας…

Μοιραστείτε αυτό το άρθρο
Τα τελευταία 20+ χρόνια γράφει για Mobile Tech, PC Tech και Business Tech σε περιοδικά και online. Αν θα έπρεπε να ξεχωρίσει δυο έντυπα που έχει δουλέψει αυτά θα ήταν το Pixel και το RAM. Αν θα έπρεπε να διαλέξει υπολογιστή αυτοί θα ήταν η Amiga και το Raspberry Pi. Αν θα έπρεπε να διαλέξει την τεχνολογία που θα επιφέρει τo μεγαλύτερο "αναστάτωμα" αυτή θα είναι το Blockchain και φυσικά η GenAI.