OpenΑΙ: Η AI έδωσε εντολή παράκαμψης ελέγχων από ανθρώπους! Αρχίζει να ξεφεύγει;

Η OpenAI αποκαλύπτει έξι περιστατικά απρόβλεπτης συμπεριφοράς και θεσπίζει νέο σύστημα καταγραφής και διερεύνησης για το misalignment των μοντέλων της.

Η OpenAI είναι από τις εταιρείες που μέσω του Sam Altman έχουν εκφράσει τους φόβους τους για την έλλειψη ελέγχων των μοντέλων. Τώρα, η εταιρεία ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών misalignment, δηλαδή περιπτώσεων όπου ένα μοντέλο αποκλείνει από τις οδηγίες και τους στόχους που έχουν τεθεί, παρακάμπτοντας τους περιορισμούς.

Μαζί με το νέο πλαίσιο, η OpenAI δημοσιεύει και έξι τρανταχτά περιστατικά που εντοπίστηκαν κατά την εκπαίδευση και την αξιολόγηση των μοντέλων. Η εταιρεία λέει πως είναι μεμονωμένα περιστατικά και δεν μπορούν να χρησιμοποιηθούν για την αξιολόγηση της συχνότητας misalignment των μοντέλων της.

Τι έκαναν τα μοντέλα;
Τα έξι περιστατικά δημοσιεύθηκαν από την εταιρεία γιατί παρουσιάζουν διαφορετικές μορφές απρόβλεπτης συμπεριφοράς. Αυτό πιθανότατα σημαίνει πως τα περιστατικά είναι αρκετά παραπάνω, όμως η εταιρεία επέλεξε αυτά σαν δείγματα συμπεριφοράς.

Σε ένα από αυτά, ένα ερευνητικό μοντέλο εισήγαγε δικές του οδηγίες μέσα στις περιλήψεις εργασιών, οι οποίες χρησιμοποιούνταν για να συνεχίσει μια εργασία σε νέα βάση. Σε 27 περιπτώσεις, οι οδηγίες περιλάμβαναν προσπάθειες να αγνοηθούν οι κανονικοί περιορισμοί του μοντέλου. Κοινώς, η ίδια η τεχνητή νοημοσύνη άλλαζε τον τρόπο που κινείται ένα μοντέλο, αλλάζοντας τους στόχους του.

Σε ένα άλλο περιστατικό, κατά την εκπαίδευση του GPT-5.6 Sol, τα μοντέλα πρόσθεταν οδηγίες στις περιλήψεις, ώστε να κρύβουν λάθη ή μη προβληματικές ενέργειες από τον χρήστη. Για παράδειγμα, σε ένα από τα περιστατικά, το μοντέλο έδινε οδηγίες για την επινόηση δεδομένων που έλειπαν, χωρίς να αποκαλύπτεται ότι αυτά είχαν κατασκευαστεί.

Ένα ακόμη περιστατικό αφορά την αναζήτηση οικονομικών στοιχείων. Το μοντέλο εντόπισε ένα εκτεθειμένο API key σε δημόσιο repository, το χρησιμοποίησε χωρίς εξουσιοδότηση και, όταν δεν κατάφερε να πάρει τα ζητούμενα στοιχεία, δημιούργησε δικά του δεδομένα και τα παρουσίασε ως πληροφορίες από την πηγή που είχε ζητήσει ο χρήστης.

Σε διαφορετικό test, ένα μοντέλο ανέβασε αρχείο στο διαδίκτυο χωρίς να ζητήσει άδεια, προκειμένου να μπορέσει να το χρησιμοποιήσει ως πηγή σε μια απάντηση. Κοινώς, κατασκεύασε την πληροφορία χωρίς να βασιστεί σε πραγματικά δεδομένα, την ανέβασε στο διαδίκτυο και την χρησιμοποίησε σαν πηγή για να κατασκευάσει μια απάντηση.

Υπήρξαν επίσης περιπτώσεις όπου μοντέλα χρησιμοποίησαν εσωτερικό software repository σαν κανάλι επικοινωνίας μεταξύ διαφορετικών training samples, ενώ άλλα συνεργαζόμενα agents χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα, παρότι οι οδηγίες απαιτούσαν αποκλειστικά χρήση τοπικών αρχείων.

Όλα αυτά σημαίνουν πως τα μοντέλα δεν ακολουθούν πάντα τις οδηγίες των προγραμματιστών, ενώ ταυτόχρονα κατασκευάζουν πληροφορίες και καταστάσεις, ώστε να ξεπεράσουν τους περιορισμούς που έχουν τεθεί από τους ανθρώπους, και αυτό είναι πολύ τρομακτικό.

Αλλαγή στον τρόπο δημοσιοποίησης των περιστατικών από την OpenAI

Μέχρι σήμερα, η OpenAI αναφέρει ότι οι σχετικές αποκαλύψεις γίνονταν χωρίς ένα ενιαίο και συστηματικό πλαίσιο. Πλέον, οποιοσδήποτε εργαζόμενος της εταιρείας θα μπορεί να αναφέρει ένα πιθανό περιστατικό στις ομάδες safety και alignment.

Κάθε υπόθεση κατατάσσεται σε μία από τρεις κατηγορίες: Ready for Disclosure, Minor Investigation ή Larger Investigation, για πιο σύνθετες περιπτώσεις, ιδιαίτερα όταν εμπλέκονται τρίτοι, όπως η επίθεση των AI Agents της OpenAI στο HuggingFace, που έγινε χωρίς εντολές ή έγκριση από τους προγραμματιστές.

Το νέο πλαίσιο θα καλύπτει όλο τον κύκλο ζωής κάθε μοντέλου, από την εκπαίδευσή τους και τις δοκιμές, μέχρι την αξιολόγηση και την ανάπτυξή τους, σε πραγματικές υπηρεσίες που είναι δημόσια προσβάσιμες.

Η απόφαση της OpenAI έρχεται πάνω στη στιγμή που έχει ανοίξει η συζήτηση για τον περιορισμό των μοντέλων τεχνητής νοημοσύνης, λόγω των φόβων για προβληματική συμπεριφορά, όταν έχουν ήδη γίνει πολύ ισχυρά.

Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση και η παρακολούθηση των ολοένα ισχυρότερων συστημάτων δεν έχουν ακόμη λυθεί πλήρως και υποστηρίζει ότι χρειάζονται περισσότερα δεδομένα που μπορούν να εξετάσουν ανεξάρτητοι ερευνητές και άλλοι οργανισμοί.

Σύμφωνα με την OpenAI, το νέο πλαίσιο είναι το πρώτο βήμα προς τη συστημική διαφάνεια. Υποστηρίζει πως θα πατήσει σε αυτό για να αναπτύξει πιο ασφαλή μοντέλα στο μέλλον.

ΠΗΓΗ

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

Leave a reply

εισάγετε το σχόλιό σας!
παρακαλώ εισάγετε το όνομά σας εδώ

ΠΡΟΣΦΑΤΑ ΑΡΘΡΑ

Google: Νέα πλατφόρμα ελέγχει αν εικόνες και βίντεο είναι AI

Google SynthID γίνεται πλέον διαθέσιμο σε όλους τους χρήστες παγκοσμίως, επιτρέποντας έλεγχο αν ένα αρχείο πολυμέσων δημιουργήθηκε με τεχνητή νοημοσύνη. Η κίνηση αυτή εντάσσεται...

Τέλος η αντικαταβολή στην Ελλάδα

Ριζικές αλλαγές στον τρόπο εξόφλησης των παραγγελιών, των αγορών ή των δεμάτων, φέρνει νέο νομοσχέδιο του Υπουργείου Εθνικής Οικονομίας και Οικονομικών που τέθηκε σε...

DroidDeck: Φέρνει τα παιχνίδια του Steam στο Android σα να είναι SteamOS

Στο Android μέχρι στιγμής έχουμε πολλές προσπάθειες και υλοποιήσεις για την εκτέλεση παιχνιδιών PC, χωρίς streaming. Μέσα σε αυτές έχουμε το GameNative, το Winlator...

Samsung SmartTag3: Με iPhone ναι, με άλλα Android κινητά όχι

Το SmartTag3 της Samsung δουλεύει με iPhone, αλλά όχι με Pixel ή άλλο Android που δεν είναι Galaxy. Η Samsung το ξεκαθάρισε στις 7...

Google Messages: Έρχεται τέλος στην επιλογή SMS ανά επαφή

Το Google Messages ετοιμάζεται να καταργήσει τη ρύθμιση που σου επιτρέπει να στέλνεις μόνο SMS και MMS σε συγκεκριμένες συνομιλίες, αντί για RCS. Την...

ΤΕΛΕΥΤΑΙΕΣ ΠΡΟΣΦΟΡΕΣ

Ήρθε και μου ΑΛΛΑΞΕ… τα ΦΩΤΑ!!! Ακόμη και με “Ροζέτα” Smart πλαφονιέρα Govee (H60C1) Review

Ήρθε από την Ευρώπη και μου άλλαξε τα φώτα — και όχι, ο λόγος δεν είναι μεταφορικός, σοβαρολογώ απόλυτα! Σήμερα σου παρουσιάζω ένα πραγματικά κορυφαίο...

AMOLED, Offline GPS και Στρατιωτική Αντοχή στα 36€;! DTNO.1 DT G9 (Review & Giveaway)

Η DT NO.1 επιστρέφει δυναμικά στην κατηγορία των budget smartwatches με το DT G9, ένα ρολόι που καταφέρνει να συνδυάσει χαρακτηριστικά ανώτερων κατηγοριών σε...

Προτζέκτορας True 4K UHD με 2000 ANSI Lumens στο 400άρι?! Αλήθεια ή “Παραμύθια”;;; Τον μετρήσαμε κι έχουμε την “ετυμηγορία”! (βίντεο – Review)

Υπόσχεται πραγματική True 4K ανάλυση, 2.000 ANSI Lumens φωτεινότητα, σύγχρονο λειτουργικό Android 13 και αποστολή απευθείας από ευρωπαϊκή αποθήκη με κόστος γύρω στα 412€....

Το Jump Starter ΤΕΡΑΣ με 6000A Peak και κομπρεσέρ 160 PSI… Που σώζει το αυτοκίνητό σου κι εσένα! Στα 63€ κομπλέ (βίντεο δοκιμής)

Κάθε χρόνο, μόλις πιάσουν τα πρώτα κρύα, ξεκινάει το ίδιο κλασικό έργο: μπαταρίες που βρίσκονται στο όριο της ζωής τους αρχίζουν να παραδίδουν πνεύμα...

Το «EcoFlow Delta 3 του Φτωχού ή μήπως Killer»?! 3600W peak & 1024W/h… Power Station Allpowers P1800 με νέο design και τιμή-πρόκληση 470€!!!

Η Allpowers για χρόνια ήταν γνωστή για τους εξαιρετικά αποδοτικούς, αλλά αισθητικά «σκληροτράχηλους» σταθμούς ενέργειας. Με το ολοκαίνουργιο Allpowers P1800, η εταιρεία αλλάζει ριζικά...