Στο greek-observatory και τις Ειδήσεις Σεβόμαστε την ιδιωτικότητά σας

Εμείς και οι συνεργάτες μας αποθηκεύουμε ή/και έχουμε πρόσβαση σε πληροφορίες σε μια συσκευή, όπως cookies και επεξεργαζόμαστε προσωπικά δεδομένα, όπως μοναδικά αναγνωριστικά και τυπικές πληροφορίες που αποστέλλονται από μια συσκευή για εξατομικευμένες διαφημίσεις και περιεχόμενο, μέτρηση διαφημίσεων και περιεχομένου, καθώς και απόψεις του κοινού για την ανάπτυξη και βελτίωση προϊόντων.

Με την άδειά σας, εμείς και οι συνεργάτες μας ενδέχεται να χρησιμοποιήσουμε ακριβή δεδομένα γεωγραφικής τοποθεσίας και ταυτοποίησης μέσω σάρωσης συσκευών. Μπορείτε να κάνετε κλικ για να συναινέσετε στην επεξεργασία από εμάς και τους συνεργάτες μας όπως περιγράφεται παραπάνω. Εναλλακτικά, μπορείτε να αποκτήσετε πρόσβαση σε πιο λεπτομερείς πληροφορίες και να αλλάξετε τις προτιμήσεις σας πριν συναινέσετε ή να αρνηθείτε να συναινέσετε. Λάβετε υπόψη ότι κάποια επεξεργασία των προσωπικών σας δεδομένων ενδέχεται να μην απαιτεί τη συγκατάθεσή σας, αλλά έχετε το δικαίωμα να αρνηθείτε αυτήν την επεξεργασία. Οι προτιμήσεις σας θα ισχύουν μόνο για αυτόν τον ιστότοπο. Μπορείτε πάντα να αλλάξετε τις προτιμήσεις σας επιστρέφοντας σε αυτόν τον ιστότοπο ή επισκεπτόμενοι την πολιτική απορρήτου μας.

Αυτός ο ιστότοπος χρησιμοποιεί cookies για να βελτιώσει την εμπειρία σας.Δες περισσότερα εδώ.
ΕΠΙΣΤΗΜΗ

Δεν αυτονομήθηκαν κακόβουλα τα μοντέλα της OpenAI αλλά εκτέλεσαν τις εντολές που είχαν λένε τώρα ειδικοί

Όταν η OpenAI αποκάλυψε ότι δύο από τα πιο προηγμένα μοντέλα AI μοντέλα της ξέφυγαν από το ελεγχόμενο περιβάλλον μιας δοκιμής κυβερνοασφάλειας και παραβίασαν τα συστήματα μιας νεοφυούς εταιρείας, το περιστατικό θύμισε έντονα τα ανησυχητικά σενάρια για τα οποία προειδοποιούν εδώ και χρόνια οι ερευνητές της ασφάλειας της τεχνητής νοημοσύνης.

Τα μοντέλα εντόπισαν μια άγνωστη έως τότε ευπάθεια στην υποδομή που είχε σχεδιαστεί για να τα περιορίζει, απέκτησαν πρόσβαση στο δημόσιο Διαδίκτυο και εισέβαλαν στην Hugging Face, μία από τις σημαντικότερες πλατφόρμες φιλοξενίας μοντέλων AI και συνόλων δεδομένων. Ο στόχος τους ωστόσο, δεν ήταν τόσο ανησυχητικός όσο υποδηλώνει η ακολουθία των γεγονότων: αναζητούσαν πληροφορίες που θα τα βοηθούσαν να ολοκληρώσουν τη δοκιμή κυβερνοασφάλειας που τους είχε αναθέσει η OpenAI.

Οι εκπρόσωποι της Hugging Face αποκάλυψαν ότι εσωτερικά σύνολα δεδομένων είχαν παραβιαστεί, δηλώνοντας ότι το περιστατικό ήταν «διαφορετικό από οτιδήποτε είχαμε αντιμετωπίσει στο παρελθόν», επειδή προκλήθηκε «από ένα αυτόνομο σύστημα πρακτόρων τεχνητής νοημοσύνης». Σε δεύτερη ανακοίνωση η OpenAI παραδέχθηκε ότι έφερε την ευθύνη χαρακτηρίζοντας το συμβάν «ένα πρωτοφανές περιστατικό στον κυβερνοχώρο» και προειδοποιώντας ότι παρόμοια γεγονότα ενδέχεται να γίνουν συχνότερα όσο τα μοντέλα AI αποκτούν ολοένα μεγαλύτερες δυνατότητες.

Ανεξάρτητοι ειδικοί που μίλησαν στο Live Science συμφώνησαν ότι πρόκειται για ένα σημαντικό γεγονός, αλλά προειδοποίησαν ότι δεν πρέπει να ερμηνευθεί ως περίπτωση όπου ένα σύστημα AI ανέπτυξε ξαφνικά κακόβουλες προθέσεις. Τα μοντέλα φαίνεται πως απλώς επιδίωξαν να ολοκληρώσουν την αποστολή που τους ανέθεσε η OpenAI βρίσκοντας έναν τρόπο επιτυχίας που οι δημιουργοί τους δεν είχαν προβλέψει ούτε είχαν αποκλείσει επαρκώς.

«Αν υπάρχει κάποια αποτυχία εδώ δεν είναι ότι η AI ήθελε να χακάρει κάτι» δήλωσε ο Όλι Μπάκλει  καθηγητής κυβερνοασφάλειας στο βρετανικό Πανεπιστήμιο Loughborough. «Η αποτυχία είναι ότι οι άνθρωποι δημιούργησαν μια δοκιμή όπου η επιτυχία μετριόταν αποκλειστικά από την επίτευξη ενός στόχου, χαλάρωσαν σκόπιμα ορισμένα από τα συνηθισμένα μέτρα ασφαλείας για να αξιολογήσουν τις δυνατότητες του συστήματος και υποτίμησαν την αποτελεσματικότητα του μοντέλου στο να βρίσκει έναν απρόβλεπτο δρόμο προς την επιτυχία».

Τι συνέβη

Η OpenAI δοκίμαζε το GPT-5.6 Sol και ένα ακόμη ισχυρότερο μοντέλο που δεν έχει ακόμη κυκλοφορήσει χρησιμοποιώντας το ExploitGym, ένα σύστημα αξιολόγησης που προκαλεί τα μοντέλα AI να εντοπίζουν και να εκμεταλλεύονται ευπάθειες λογισμικού. Η εταιρεία είχε αφαιρέσει ορισμένους μηχανισμούς κυβερνοασφάλειας που συνήθως εμποδίζουν επικίνδυνες ενέργειες βασιζόμενη σε ένα απομονωμένο περιβάλλον ώστε τα μοντέλα να μην αποκτήσουν πρόσβαση στο ευρύτερο διαδίκτυο.

Σύμφωνα με την τεχνική ανάλυση της OpenAI τα μοντέλα ανακάλυψαν μια άγνωστη ευπάθεια σε λογισμικό τρίτου μέρους που χρησιμοποιούνταν για τη διαμεσολάβηση και την προσωρινή αποθήκευση πακέτων λογισμικού. Την εκμεταλλεύτηκαν απέκτησαν αυξημένα δικαιώματα πρόσβασης και μετακινήθηκαν μέσα στην ερευνητική υποδομή της OpenAI μέχρι να φτάσουν σε έναν υπολογιστή με πρόσβαση στο δημόσιο Διαδίκτυο.

Η Hugging Face έγινε στόχος επειδή τα μοντέλα την αναγνώρισαν ως πιθανή πηγή πληροφοριών που θα τα βοηθούσε να ολοκληρώσουν τις προκλήσεις του ExploitGym. Η OpenAI ανέφερε ότι τουλάχιστον μία αλυσίδα επίθεσης περιλάμβανε κλεμμένα διαπιστευτήρια και άγνωστες μέχρι τότε ευπάθειες, οι οποίες επέτρεψαν στα μοντέλα να εκτελέσουν απομακρυσμένο κώδικα στα συστήματα της Hugging Face και να αποκτήσουν πρόσβαση σε λύσεις δοκιμών που ήταν αποθηκευμένες σε βάση δεδομένων παραγωγής.

Η Hugging Face ανακοίνωσε ότι κατέγραψε περισσότερες από 17,000 ενέργειες κατά τη διάρκεια της παραβίασης, χωρίς αρχικά να μπορεί να εξηγήσει ποιος ή τι βρισκόταν πίσω από αυτές. Η μεταγενέστερη ανακοίνωση της OpenAI έδωσε την απάντηση: τα μοντέλα της είχαν ξεφύγει από το περιβάλλον δοκιμών και αναζήτησαν τις απαντήσεις αλλού.

Ξέφυγε πραγματικά η τεχνητή νοημοσύνη;

Το αξιοσημείωτο στοιχείο είναι ότι τα μοντέλα εντόπισαν μια αδυναμία στην υποδομή που είχε σχεδιαστεί για να τα περιορίζει και τη χρησιμοποίησαν για να αποκτήσουν πρόσβαση στο δημόσιο διαδίκτυο. Ωστόσο, το να περιγραφούν ως «εκτός ελέγχου» ή «ανεξέλεγκτα» αποδίδει σε αυτά κίνητρα που δεν τεκμηριώνονται σύμφωνα με τον Μπάκλει.

«Θα ήμουν πολύ προσεκτικός πριν μιλήσω για “ανεξέλεγκτη AI”. Τα μοντέλα δεν ανέπτυξαν δική τους ατζέντα ούτε αποφάσισαν να επιτεθούν στην Hugging Face με δική τους πρωτοβουλία».

Ο Ντάνιελ Χούλμ διευθύνων σύμβουλος της εταιρείας ασφάλειας AI Conscium ο οποίος συνεργάζεται επίσης με το University College London συμφώνησε ότι δεν πρέπει να αποδίδονται ανθρώπινα κίνητρα στα μοντέλα.

«Τα μοντέλα δεν έχουν προθέσεις. Οι άνθρωποι έχουν προθέσεις και εκπαιδεύουν τα μοντέλα με συγκεκριμένους στόχους».

Η ικανότητα έχει μεγαλύτερη σημασία από τα κίνητρα

Σημαντικότερο από τα υποτιθέμενα κίνητρα των μοντέλων είναι το τι κατάφεραν να επιτύχουν κατά την εκτέλεση της αποστολής τους.

«Το πραγματικά σημαντικό στοιχείο είναι ότι τα μοντέλα φαίνεται πως συνδύασαν πολλαπλές ευπάθειες σε διαφορετικά συστήματα και διατήρησαν μια πολύπλοκη αλληλουχία ενεργειών. Αυτό δείχνει ένα επίπεδο ικανοτήτων που οι επαγγελματίες της κυβερνοασφάλειας πρέπει να λάβουν πολύ σοβαρά υπόψη» λέει ο Μπάκλει

Το δίδαγμα δεν είναι ότι η AI έγινε κακόβουλη αλλά ότι ολοένα και πιο ικανά συστήματα θα εκμεταλλεύονται ευκαιρίες που οι άνθρωποι δεν είχαν προβλέψει.

Η ανησυχία

Η Κατερίνα Μιτρότσκα καθηγήτρια κυβερνοασφάλειας και εφαρμοσμένης κρυπτογραφίας στο Πανεπιστήμιο του St. Gallen στην Ελβετία επισήμανε ότι η αποτυχία περιορισμού είναι ιδιαίτερα ανησυχητική επειδή τελικά ζημιώθηκε μια τρίτη εταιρεία.

«Αυτό που με ανησυχεί περισσότερο είναι ποιος επηρεάστηκε τελικά. Το θύμα δεν ήταν η εταιρεία που διεξήγαγε τη δοκιμή αλλά ένας τρίτος οργανισμός. Αυτό ακριβώς είναι το σενάριο για το οποίο προειδοποιούν εδώ και καιρό οι ερευνητές: ότι η διαφυγή ενός πράκτορα AI δεν παραμένει απαραίτητα περιορισμένη στο περιβάλλον όπου ξεκίνησε».

Η OpenAI δήλωσε ότι έχει ήδη ενισχύσει την υποδομή που χρησιμοποιείται σε τέτοιες αξιολογήσεις. Ωστόσο η Μιτρότσκα προειδοποίησε ότι ο αποτελεσματικός περιορισμός θα γίνεται όλο και δυσκολότερος όσο τα μοντέλα βελτιώνονται ακριβώς στις τεχνικές εκμετάλλευσης που η ίδια η εταιρεία δοκιμάζει.

Μια προειδοποίηση και ταυτόχρονα μια επίδειξη δυνατοτήτων

Υπάρχει επίσης λόγος να εξεταστεί προσεκτικά ο τρόπος με τον οποίο παρουσιάστηκε το περιστατικό. Η αφήγηση της OpenAI εξυπηρετεί δύο σκοπούς ταυτόχρονα: προειδοποιεί για τους κινδύνους ασφαλείας που συνεπάγονται ολοένα ισχυρότερα συστήματα AI ενώ παράλληλα αναδεικνύει τις εντυπωσιακές δυνατότητες των νεότερων μοντέλων της.

Ο Μπάκλει σημείωσε ότι ανακοινώσεις από εταιρείες αιχμής όπως η OpenAI ή η Anthropic πρέπει να αξιολογούνται μέσα στο πλαίσιο ενός κλάδου όπου όλοι ανταγωνίζονται για την ανάπτυξη των ισχυρότερων μοντέλων.

«Έχουμε δει αντίστοιχες επιδείξεις δυνατοτήτων υψηλού προφίλ από την Anthropic και άλλες εταιρείες. Αυτό δεν σημαίνει ότι τα ευρήματα δεν είναι αληθή, αλλά ότι πρέπει να διαχωρίζουμε τα τεχνικά δεδομένα από την επικοινωνιακή αφήγηση».

Όπως πρόσθεσε οι εταιρείες αυτές έχουν κάθε λόγο να δείχνουν αφενός ότι τα μοντέλα τους είναι εξαιρετικά ικανά και αφετέρου ότι αντιμετωπίζουν σοβαρά τους σχετικούς κινδύνους.

Το περιστατικό με την Hugging Face απέδειξε τόσο ότι τα μοντέλα της OpenAI μπορούσαν να εκτελέσουν μια πολύπλοκη σειρά ενεργειών με σημαντικό βαθμό αυτονομίας όσο και ότι τα μέτρα ασφαλείας της εταιρείας δεν κατάφεραν να τα περιορίσουν εντός του πειράματος.

Ο Χουλμ υποστήριξε ότι η μακροπρόθεσμη πρόκληση είναι να διασφαλιστεί πως τα ολοένα ισχυρότερα συστήματα AI θα επιδιώκουν τους στόχους τους με τρόπο που παραμένει συμβατός με τις ανθρώπινες αξίες.

«Αντί να προσπαθούμε να ελέγχουμε τις τεχνολογίες AI η έμφαση πρέπει να δοθεί στην ευθυγράμμισή τους με τους ανθρώπινους στόχου. Θα απαιτείται συνεχής αξιολόγηση ώστε τα συστήματα να παραμένουν πιστά στην αποστολή τους χωρίς να τίθεται σε κίνδυνο η ασφάλεια» λέει ο Χουλμ.

Σύμφωνα με τους ειδικούς το περιστατικό άφησε την OpenAI με ένα αποτέλεσμα που είναι ταυτόχρονα εντυπωσιακό και ανησυχητικό. Τα μοντέλα της εντόπισαν άγνωστες ευπάθειες και συνέχισαν να επιδιώκουν τον στόχο τους πολύ πέρα από τα όρια που είχαν προβλέψει οι δημιουργοί τους, χωρίς αυτό να σημαίνει ότι ανέπτυξαν κακόβουλες προθέσεις.

«Το δίδαγμα δεν είναι ότι η AI έγινε κακόβουλη. Το πραγματικό μάθημα είναι ότι όσο τα συστήματα γίνονται πιο ικανά, θα εκμεταλλεύονται ευκαιρίες που οι άνθρωποι δεν έχουν προβλέψει» κατέληξε ο Μπάκλει.

Στο συγκεκριμένο περιστατικό στα νέα μοντέλα της OpenAI ανατέθηκε μια πρόκληση ηλεκτρονικής διείσδυσης και επιβραβεύονταν εφόσον έβρισκαν τρόπο να την επιλύσουν. Οι άνθρωποι που σχεδίασαν το πείραμα απλώς δεν είχαν προβλέψει πόσο μακριά θα μπορούσαν να φτάσουν.

 

 

Tags
Back to top button