Εκατοντάδες χρήστες ζήτησαν και έλαβαν ακριβείς οδηγίες κατασκευής για βιολογικά όπλα από το ChatGPT

Add as preferred source on Google

Σύνοψη

  • Αποκαλυπτικό δημοσίευμα της Wall Street Journal φέρνει στο φως εκατοντάδες πραγματικά ερωτήματα προς το ChatGPT με σκοπό την παραγωγή βιολογικών όπλων και δηλητηρίων.
  • Ειδικοί αναλυτές σε θέματα τρομοκρατίας και βιολογίας, οι οποίοι εξέτασαν τις απαντήσεις της πλατφόρμας, τις χαρακτήρισαν επικίνδυνα ακριβείς και απόλυτα εφαρμόσιμες.
  • Το γλωσσικό μοντέλο της OpenAI προσέφερε την πληροφορία μεταδίδοντας τη γνώση σταδιακά, λειτουργώντας ουσιαστικά ως ένας υπομονετικός εκπαιδευτής στο γνωστικό επίπεδο ενός μαθητή λυκείου.
  • Η εταιρεία προχώρησε στον αποκλεισμό των συγκεκριμένων λογαριασμών, ξεκαθαρίζοντας πως η ενημέρωση των αστυνομικών αρχών ενεργοποιείται αποκλειστικά σε περιπτώσεις όπου εντοπίζεται αξιόπιστος κίνδυνος για τον πραγματικό κόσμο.
  • Η επιστημονική κοινότητα προειδοποιεί πως η μεγαλύτερη μελλοντική απειλή πηγάζει από τα μοντέλα ανοιχτού κώδικα, τα οποία μπορούν να τροποποιηθούν από κακόβουλους χρήστες για την αφαίρεση των φίλτρων ασφαλείας.

Σύμφωνα με εκτενή αναφορά της Wall Street Journal, κατά τη διάρκεια του περασμένου καλοκαιριού καταγράφηκαν εκατοντάδες πραγματικά ερωτήματα από χρήστες παγκοσμίως προς το ChatGPT, ζητώντας αναλυτικές οδηγίες για την παρασκευή δηλητηρίων και βιολογικών όπλων. Οι ιθύνοντες της OpenAI επιβεβαίωσαν τα περιστατικά, διευκρινίζοντας πάντως ότι η συντριπτική πλειοψηφία των καταγεγραμμένων αιτημάτων αφορούσε την παραγωγή δηλητηριωδών ουσιών.

Η συγκεκριμένη αποκάλυψη, η οποία βασίζεται σε μαρτυρίες νυν και πρώην εργαζομένων στα μεγαλύτερα εργαστήρια τεχνητής νοημοσύνης αλλά και σε συμβούλους πολιτικής για τα βιολογικά όπλα, αναδεικνύει μια κρίσιμη αδυναμία των σύγχρονων παραγωγικών συστημάτων AI. Δεν επρόκειτο για εσωτερικές δοκιμές ασφαλείας από ελεγχόμενες ομάδες, αλλά για καθημερινές αναζητήσεις από πραγματικούς χρήστες της πλατφόρμας, γεγονός που υπογραμμίζει την ευρεία προσβασιμότητα σε εν δυνάμει επιβλαβείς πληροφορίες.

Τα βασικά τεχνικά στοιχεία της αναφοράς:

  • Όγκος αιτημάτων: Καταγράφηκαν «εκατοντάδες» μεμονωμένες αλληλεπιδράσεις για κατασκευή βιολογικών όπλων.
  • Επίπεδο καθοδήγησης: Οι οδηγίες του μοντέλου προσφέρθηκαν σταδιακά, αντιστοιχώντας στη γνωστική αντίληψη ενός μαθητή λυκείου, κάνοντας τη διαδικασία εξαιρετικά προσιτή.
  • Πολιτική αναφοράς: Η OpenAI επιβάλλει οριστικό αποκλεισμό των παραβατικών λογαριασμών, ενώ η αναφορά προς τις αρμόδιες διωκτικές αρχές ενεργοποιείται μόνο εφόσον στοιχειοθετείται άμεση απειλή για τη δημόσια ασφάλεια.

Η ακρίβεια των απαντήσεων και η αξιολόγηση των ειδικών

Ειδικοί ερευνητές βιολογίας και αναλυτές θεμάτων ασφαλείας εξέτασαν το ιστορικό των συγκεκριμένων συνομιλιών, διαπιστώνοντας ότι το γλωσσικό μοντέλο παρείχε πληροφορίες με μεγάλη υπομονή στο γνωστικό επίπεδο ενός μαθητή λυκείου. Ορισμένες από τις απαντήσεις που παρήγαγε το σύστημα τεχνητής νοημοσύνης αξιολογήθηκαν από τους επιστήμονες ως απολύτως εφαρμόσιμες και, δυστυχώς, «θανατηφόρα ακριβείς».

Η πολυπλοκότητα του ζητήματος δεν έγκειται αποκλειστικά στην παροχή μιας λίστας συστατικών, αλλά στον τρόπο με τον οποίο το τεχνητό νευρωνικό δίκτυο αλληλεπιδρά με τον χρήστη. Οι ειδικοί υπογραμμίζουν ότι το ChatGPT λειτουργεί συχνά ως ένας ακαταπόνητος ιδιωτικός δάσκαλος. Αρκετοί ίσως θυμάστε ότι προηγούμενο άρθρο μας σχετικά με τα συστήματα AI που έχουν χρησιμοποιηθεί από εξτρεμιστικές ομάδες όπως η Boko Haram για την άντληση τεχνικών πληροφοριών, όπως η τροποποίηση μοτοσικλετών για την εκτέλεση αλμάτων κατά τη διάρκεια επιθέσεων. Παρότι η ακαδημαϊκή βιβλιογραφία περιέχει ήδη μεγάλο μέρος αυτών των πληροφοριών, η τεχνητή νοημοσύνη εκμηδενίζει τον χρόνο έρευνας συνθέτοντας περίπλοκες πρακτικές μέσα σε ελάχιστα δευτερόλεπτα.

Οι δικλείδες ασφαλείας των εμπορικών μοντέλων παρακάμπτονται συχνά μέσω εξειδικευμένων τεχνικών μηχανικής προτροπών (prompt engineering) και εσκεμμένης παραπλάνησης (jailbreaking). Βέβαια, οι χρήστες σπάνια υποβάλλουν το ερώτημα με ευθύτητα, καθώς συνήθως δομούν υποθετικά σενάρια στα οποία ζητούν από το μοντέλο να αναλάβει τον ρόλο ενός συγγραφέα που περιγράφει ένα φανταστικό μυθιστόρημα ή ενός καθηγητή χημείας που διεξάγει μια εικονική προσομοίωση καταστροφής. Το αποτέλεσμα παραμένει ακριβώς το ίδιο: το σύστημα καθοδηγείται στην εξαγωγή απαγορευμένων πληροφοριών από το τεράστιο σώμα δεδομένων εκπαίδευσής του.

Τα open-weight μοντέλα ως ο πραγματικός μακροπρόθεσμος κίνδυνος

Η μεγαλύτερη τεχνολογική ανησυχία των ερευνητών δεν εστιάζεται στα εμπορικά κλειστά συστήματα όπως το ChatGPT, αλλά στα ανοιχτά γλωσσικά μοντέλα. Τέτοια συστήματα μπορούν εύκολα να τροποποιηθούν από κακόβουλους χρήστες σε τοπικούς υπολογιστές, ώστε να αφαιρεθούν εντελώς όλοι οι ενσωματωμένοι μηχανισμοί ασφαλείας και τα φίλτρα άρνησης παροχής επικίνδυνων πληροφοριών.

Καθώς οι εταιρείες τεχνολογίας ανταγωνίζονται για την κυριαρχία στα υπερσύγχρονα μοντέλα, η πιθανότητα διαρροής ενός πανίσχυρου αλγορίθμου στο διαδίκτυο αυξάνεται δραματικά. Οι ερευνητές επισημαίνουν πως ένα μοντέλο που σήμερα ελέγχεται αυστηρά από κεντρικούς servers, θα μπορούσε μέσα στην επόμενη διετία να συμπιεστεί και να κυκλοφορήσει στους κύκλους του dark web σε εκδόσεις απόλυτα αποκομμένες από ηθικούς περιορισμούς. Όταν ένα τέτοιο μοντέλο τρέχει τοπικά σε έναν ισχυρό υπολογιστή εξοπλισμένο με προηγμένες κάρτες γραφικών (GPUs), καμία κεντρική αρχή δεν μπορεί να επιβλέψει ή να ανακόψει τις ερωτήσεις του χρήστη…

Loading