OpenΑΙ: Η AI έδωσε εντολή παράκαμψης ελέγχων από ανθρώπους! Αρχίζει να ξεφεύγει;

Η OpenAI αποκαλύπτει έξι περιστατικά απρόβλεπτης συμπεριφοράς και θεσπίζει νέο σύστημα καταγραφής και διερεύνησης για το misalignment των μοντέλων της.

Η OpenAI είναι από τις εταιρείες που μέσω του Sam Altman έχουν εκφράσει τους φόβους τους για την έλλειψη ελέγχων των μοντέλων. Τώρα, η εταιρεία ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών misalignment, δηλαδή περιπτώσεων όπου ένα μοντέλο αποκλείνει από τις οδηγίες και τους στόχους που έχουν τεθεί, παρακάμπτοντας τους περιορισμούς.

Μαζί με το νέο πλαίσιο, η OpenAI δημοσιεύει και έξι τρανταχτά περιστατικά που εντοπίστηκαν κατά την εκπαίδευση και την αξιολόγηση των μοντέλων. Η εταιρεία λέει πως είναι μεμονωμένα περιστατικά και δεν μπορούν να χρησιμοποιηθούν για την αξιολόγηση της συχνότητας misalignment των μοντέλων της.

Τι έκαναν τα μοντέλα;
Τα έξι περιστατικά δημοσιεύθηκαν από την εταιρεία γιατί παρουσιάζουν διαφορετικές μορφές απρόβλεπτης συμπεριφοράς. Αυτό πιθανότατα σημαίνει πως τα περιστατικά είναι αρκετά παραπάνω, όμως η εταιρεία επέλεξε αυτά σαν δείγματα συμπεριφοράς.

Σε ένα από αυτά, ένα ερευνητικό μοντέλο εισήγαγε δικές του οδηγίες μέσα στις περιλήψεις εργασιών, οι οποίες χρησιμοποιούνταν για να συνεχίσει μια εργασία σε νέα βάση. Σε 27 περιπτώσεις, οι οδηγίες περιλάμβαναν προσπάθειες να αγνοηθούν οι κανονικοί περιορισμοί του μοντέλου. Κοινώς, η ίδια η τεχνητή νοημοσύνη άλλαζε τον τρόπο που κινείται ένα μοντέλο, αλλάζοντας τους στόχους του.

Σε ένα άλλο περιστατικό, κατά την εκπαίδευση του GPT-5.6 Sol, τα μοντέλα πρόσθεταν οδηγίες στις περιλήψεις, ώστε να κρύβουν λάθη ή μη προβληματικές ενέργειες από τον χρήστη. Για παράδειγμα, σε ένα από τα περιστατικά, το μοντέλο έδινε οδηγίες για την επινόηση δεδομένων που έλειπαν, χωρίς να αποκαλύπτεται ότι αυτά είχαν κατασκευαστεί.

Ένα ακόμη περιστατικό αφορά την αναζήτηση οικονομικών στοιχείων. Το μοντέλο εντόπισε ένα εκτεθειμένο API key σε δημόσιο repository, το χρησιμοποίησε χωρίς εξουσιοδότηση και, όταν δεν κατάφερε να πάρει τα ζητούμενα στοιχεία, δημιούργησε δικά του δεδομένα και τα παρουσίασε ως πληροφορίες από την πηγή που είχε ζητήσει ο χρήστης.

Σε διαφορετικό test, ένα μοντέλο ανέβασε αρχείο στο διαδίκτυο χωρίς να ζητήσει άδεια, προκειμένου να μπορέσει να το χρησιμοποιήσει ως πηγή σε μια απάντηση. Κοινώς, κατασκεύασε την πληροφορία χωρίς να βασιστεί σε πραγματικά δεδομένα, την ανέβασε στο διαδίκτυο και την χρησιμοποίησε σαν πηγή για να κατασκευάσει μια απάντηση.

Υπήρξαν επίσης περιπτώσεις όπου μοντέλα χρησιμοποίησαν εσωτερικό software repository σαν κανάλι επικοινωνίας μεταξύ διαφορετικών training samples, ενώ άλλα συνεργαζόμενα agents χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα, παρότι οι οδηγίες απαιτούσαν αποκλειστικά χρήση τοπικών αρχείων.

Όλα αυτά σημαίνουν πως τα μοντέλα δεν ακολουθούν πάντα τις οδηγίες των προγραμματιστών, ενώ ταυτόχρονα κατασκευάζουν πληροφορίες και καταστάσεις, ώστε να ξεπεράσουν τους περιορισμούς που έχουν τεθεί από τους ανθρώπους, και αυτό είναι πολύ τρομακτικό.

Αλλαγή στον τρόπο δημοσιοποίησης των περιστατικών από την OpenAI

Μέχρι σήμερα, η OpenAI αναφέρει ότι οι σχετικές αποκαλύψεις γίνονταν χωρίς ένα ενιαίο και συστηματικό πλαίσιο. Πλέον, οποιοσδήποτε εργαζόμενος της εταιρείας θα μπορεί να αναφέρει ένα πιθανό περιστατικό στις ομάδες safety και alignment.

Κάθε υπόθεση κατατάσσεται σε μία από τρεις κατηγορίες: Ready for Disclosure, Minor Investigation ή Larger Investigation, για πιο σύνθετες περιπτώσεις, ιδιαίτερα όταν εμπλέκονται τρίτοι, όπως η επίθεση των AI Agents της OpenAI στο HuggingFace, που έγινε χωρίς εντολές ή έγκριση από τους προγραμματιστές.

Το νέο πλαίσιο θα καλύπτει όλο τον κύκλο ζωής κάθε μοντέλου, από την εκπαίδευσή τους και τις δοκιμές, μέχρι την αξιολόγηση και την ανάπτυξή τους, σε πραγματικές υπηρεσίες που είναι δημόσια προσβάσιμες.

Η απόφαση της OpenAI έρχεται πάνω στη στιγμή που έχει ανοίξει η συζήτηση για τον περιορισμό των μοντέλων τεχνητής νοημοσύνης, λόγω των φόβων για προβληματική συμπεριφορά, όταν έχουν ήδη γίνει πολύ ισχυρά.

Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση και η παρακολούθηση των ολοένα ισχυρότερων συστημάτων δεν έχουν ακόμη λυθεί πλήρως και υποστηρίζει ότι χρειάζονται περισσότερα δεδομένα που μπορούν να εξετάσουν ανεξάρτητοι ερευνητές και άλλοι οργανισμοί.

Σύμφωνα με την OpenAI, το νέο πλαίσιο είναι το πρώτο βήμα προς τη συστημική διαφάνεια. Υποστηρίζει πως θα πατήσει σε αυτό για να αναπτύξει πιο ασφαλή μοντέλα στο μέλλον.

ΠΗΓΗ

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

Leave a reply

εισάγετε το σχόλιό σας!
παρακαλώ εισάγετε το όνομά σας εδώ

ΠΡΟΣΦΑΤΑ ΑΡΘΡΑ

Το PlayStation 5 αποκτά δωρεάν τηλεόραση με πάνω από 100 κανάλια

Η Sony προσθέτει μια νέα δυνατότητα στο PlayStation 5, μετατρέποντας ουσιαστικά την κονσόλα σε μια ακόμη συσκευή για τηλεοπτική ψυχαγωγία. Η νέα υπηρεσία Live TV...

Honor 700 Pro: Έρχεται με οθόνη στην πλάτη, όπως τα Xiaomi

Το Honor 700 Pro θα έχει οθόνη 1,72 ιντσών στην πλάτη, επίπεδη οθόνη 6,57 ιντσών 1.5K και κάμερα 200MP, σύμφωνα με νέα διαρροή από...

Huawei Mate 90 Pro Max: Τηλεφακός 200MP στο ίδιο μέγεθος με την κύρια κάμερα και εξωτερικός φακός

Διαρροή για το Huawei Mate 90 Pro Max: κύρια κάμερα 50MP με RYYB, περισκοπικός 200MP SmartSens με ζουμ 4x και εξωτερικό αξεσουάρ φακού. Ο τηλεφακός...

OnePlus Watch 4… Με πληρωμές NFC, Google Wallet, Gemini, Play store. Από Τιτάνιο!!! Το “ΠΡΑΓΜΑΤΙΚΟ” Δικό μου Smartwatch Στα 219€ Κομπλέ (Video)

Διάβασε Προσεκτικά... Με Premium Σχεδιασμό από κράμα Τιτανίου για Αξεπέραστη Άνεση, με Κορυφαία Αρχιτεκτονική Διπλού Επεξεργαστή Snapdragon W5 & BES2800, με Αυτονομία που Αγγίζει τις...

Μάθαμε τις τιμές για την Ελλάδα των Xiaomi Redmi Note 17 series

Στο επίσημο event ανακοίνωσης των Xiaomi Redmi Note 17 Series στη Βουδαπέστη, η Xiaomi έδωσε  τις τιμές της οικογένειας Redmi Note 17 στην Ελλάδα. Αρχικά,...

ΤΕΛΕΥΤΑΙΕΣ ΠΡΟΣΦΟΡΕΣ

OnePlus Watch 4… Με πληρωμές NFC, Google Wallet, Gemini, Play store. Από Τιτάνιο!!! Το “ΠΡΑΓΜΑΤΙΚΟ” Δικό μου Smartwatch Στα 219€ Κομπλέ (Video)

Διάβασε Προσεκτικά... Με Premium Σχεδιασμό από κράμα Τιτανίου για Αξεπέραστη Άνεση, με Κορυφαία Αρχιτεκτονική Διπλού Επεξεργαστή Snapdragon W5 & BES2800, με Αυτονομία που Αγγίζει τις...

Ασφάλεια με τεχνολογία Ai που ………άει. Οι Νέες Reolink είναι εδώ. (Bίντεο – συνέντευξη)

Το Ai πλέον έχει μπει παντού στην ζωή μας και πλέον σε όλους τους τομείς ο ανταγωνισμός σίγουρα σε κάποια πράγματα κάνει "θαύματα"! Η Reolink...

Το Power Bank “από το Μέλλον” Σήμερα… VEGER PowerCAN 20 κατευθείαν από την Γερμανία! (βίντεο)

Αλληγορικά ή πραγματικά σε αυτό το βίντεο και το άρθρο ταξιδεύουμε από παρόν στο παρελθόν και στο μέλλον... Έχω ήδη στα χέρια μου το  PowerCAN...

Ο Εξοπλισμός μου για την IFA και “Βόλτα” στο Βερολίνο… #travel #IFA #Germany #Berlin #foryourepage @insta360_official @samsunggreece @ninkear

Το πρώτο βίντεο από μια σειρά που θα ακολουθήσει μετά την επίσκεψη μου στην Διεθνή έκθεση τεχνολογίας IFA 2026 στο Βερολίνο. Μένεις συντονισμένος γιατί έχεις...

Για Σπιτικό, Αγνό Παγωτό, Milk Shake, Shorbet ή ότι άλλο… “Απίθανη” και “Τσάμπα” 10 σε 1 Παγωτομηχανή Teendow KF-2501U1 Στα 91€ κομπλέ από...

Αν θέλεις Αγνό, υγιεινό, σπιτικό παγωτό, Milk Shake, Shorbet ή ότι άλλο... η "Απίθανη" και "Τσάμπα" 10 σε 1 Παγωτομηχανή Teendow KF-2501U1 είναι για...