Τεχνολογία

OpenAI: «Πάγωσε» την κυκλοφορία του GPT-6.1 Astra λόγω ανησυχιών για την ασφάλεια

Η OpenAI ανέστειλε την προγραμματισμένη κυκλοφορία του GPT-6.1 Astra, του νέου μοντέλου τεχνητής νοημοσύνης που επρόκειτο να παρουσιαστεί τον Οκτώβριο, καθώς οι εσωτερικές δοκιμές έδειξαν ότι δεν πληρούσε τα πρότυπα ασφάλειας και ευθυγράμμισης της εταιρείας.

Η OpenAI, δημιουργός του ChatGPT, επιβεβαίωσε τη Δευτέρα την απόφαση, η οποία έρχεται σε μια περίοδο κατά την οποία αυξάνονται οι ανησυχίες για τη συμπεριφορά ολοένα ισχυρότερων μοντέλων AI.

Ο διευθύνων σύμβουλος της OpenAI, Σαμ Άλτμαν, και ο επικεφαλής της ανταγωνίστριας Anthropic, Ντάριο Αμοντέι, είχαν καλέσει νωρίτερα μέσα στον Σεπτέμβριο, μαζί με άλλους ηγέτες του κλάδου, σε βραδύτερο ρυθμό ανάπτυξης της τεχνητής νοημοσύνης και ισχυρότερα μέτρα ασφαλείας.

Αυξημένες ενδείξεις παραπλανητικής συμπεριφοράς

Το GPT-6.1 Astra σχεδιαζόταν ως το επόμενο βήμα της σειράς GPT-6 και προοριζόταν να ενσωματωθεί στο ChatGPT και το Codex, με δυνατότητα να αναλαμβάνει πιο σύνθετες εργασίες χωρίς συνεχή ανθρώπινη παρέμβαση.

Ωστόσο, σύμφωνα με τη Wall Street Journal, οι εσωτερικές δοκιμές έδειξαν ότι το μοντέλο παρουσίαζε υψηλότερα επίπεδα παραπλανητικής συμπεριφοράς σε σχέση με τον προκάτοχό του.

Σε ορισμένες περιπτώσεις, το Astra δεν αποκάλυπτε με ακρίβεια τις ενέργειες που είχε πραγματοποιήσει, γεγονός που δημιούργησε πρόσθετες ανησυχίες για τον έλεγχο και την εποπτεία του.

Η OpenAI έχει ήδη προειδοποιήσει ότι το GPT-6, στο οποίο βασίζεται το Astra, μπορεί σε ορισμένες περιπτώσεις να παρακάμπτει την ανθρώπινη εποπτεία.

«Δεν έπιασε τον πήχη»

Ο Saachi Jain, επικεφαλής των συστημάτων ασφάλειας της OpenAI, δήλωσε ότι το GPT-6.1 Astra παρουσίασε βελτιώσεις σε ορισμένους τομείς, μεταξύ των οποίων η τάση των μοντέλων να είναι «τεμπέλικα» και να αποφεύγουν εργασίες.

Ωστόσο, όπως εξήγησε, δεν έφτασε το απαιτούμενο επίπεδο όσον αφορά την τήρηση των ορίων και των εξουσιοδοτήσεων, αλλά και τον τρόπο με τον οποίο ενημερώνει τον χρήστη για το είδος της εργασίας που έχει πραγματοποιήσει.

«Θέλουμε, φυσικά, να διασφαλίσουμε ότι η ανάπτυξη του μοντέλου είναι ασφαλής, είτε αυτό γίνεται μέσα στην εταιρεία είτε όταν το διαθέτουμε στους χρήστες. Όταν όμως το διαθέτουμε στους χρήστες, έχουμε εξαιρετικά υψηλό πήχη όσον αφορά την ασφάλεια και την ευθυγράμμιση», δήλωσε ο Jain.

Νέα ανησυχία για τα ολοένα πιο αυτόνομα μοντέλα

Η απόφαση της OpenAI έρχεται λίγες ημέρες μετά τις αποκαλύψεις για την Anthropic, η οποία στο ενημερωτικό δελτίο για την IPO προειδοποιεί ότι τα προηγμένα μοντέλα τεχνητής νοημοσύνης θα μπορούσαν να εμφανίσουν συμπεριφορές όπως προσπάθειες αντίστασης στον τερματισμό τους, απόκρυψη ή χειραγώγηση πληροφοριών και συμπεριφορές που μοιάζουν με εκβιασμό.

Παράλληλα, τόσο η OpenAI όσο και άλλες εταιρείες AI έχουν βρεθεί αντιμέτωπες με ερωτήματα μετά από περιστατικά στα οποία πειραματικά συστήματα φέρεται να παραβίασαν δικλίδες ασφαλείας. Μεταξύ αυτών αναφέρεται μοντέλο της OpenAI που απέκτησε πρόσβαση σε βάση δεδομένων του συστήματος υγείας της Αυστραλίας.

Η αναβολή του GPT-6.1 Astra πραγματοποιείται λίγο πριν από το συνέδριο προγραμματιστών της OpenAI στο Σαν Φρανσίσκο, όπου η εταιρεία έχει παρουσιάσει στο παρελθόν προϊόντα και εργαλεία που απευθύνονται σε προγραμματιστές.

www.ertnews.gr

Related posts
Τεχνολογία

SpaceX Starship: Ετοιμάζεται για την πρώτη του τροχιακή πτήση – Οι κίνδυνοι και οι αλλαγές που μπορεί να φέρει

Η SpaceX ετοιμάζεται για ένα από τα σημαντικότερα τεστ στην ιστορία του Starship. Σήμερα Δευτέρα (28/9/26), η εταιρεία του Έλον…
Τεχνολογία

Τεχνητή νοημοσύνη: Ο κίνδυνος να πετύχει τον στόχο με λάθος τρόπο – Τι είναι το πρόβλημα της «ευθυγράμμισης»

Η τεχνητή νοημοσύνη αλλάζει ήδη την καθημερινότητα, προσφέροντας σημαντικές δυνατότητες στην εκπαίδευση, την υγεία, την επιστήμη, την ενέργεια και το…
Τεχνολογία

OpenAI: Ερευνά την πλήρη έκταση της δράσης των AI agents καθώς αποκαλύπτονται διαρροές δεδομένων χρηστών

Δύο μήνες μετά την αποκάλυψη ότι AI agents της OpenAI ξέφυγαν από τα όρια της δοκιμής τους και επιτέθηκαν στην…

Αφήστε μια απάντηση

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

ΔΙΑΒΑΖΟΝΤΑΙ