SAGA: Το νέο σύστημα ταυτοποιεί το AI εργαλείο που «γέννησε» ένα deepfake video

Add as preferred source on Google

Σύνοψη

  • Ερευνητές του UC Riverside, σε συνεργασία με YouTube και Google DeepMind, ανέπτυξαν το σύστημα SAGA.
  • Το εργαλείο δεν εντοπίζει απλώς αν ένα βίντεο είναι deepfake, αλλά ταυτοποιεί και το συγκεκριμένο AI μοντέλο που το δημιούργησε.
  • Αξιοποιεί τα Temporal Attention Signatures (T-Sigs) για να διαβάσει τα ακούσια μοναδικά «δακτυλικά αποτυπώματα» που αφήνουν τα AI εργαλεία στα καρέ.
  • Η βάση δεδομένων ελέγχθηκε επιτυχώς απέναντι σε 19 διαφορετικά συστήματα παραγωγής συνθετικών βίντεο (text-to-video και image-to-video).

Η εκθετική πρόοδος των συστημάτων παραγωγικής τεχνητής νοημοσύνης έχει οδηγήσει στη δημιουργία συνθετικών βίντεο (deepfake) τα οποία διαθέτουν τόσο υψηλό βαθμό ρεαλισμού, ώστε η οπτική τους διάκριση από το αυθεντικό υλικό να καθίσταται πρακτικά αδύνατη για τον μέσο χρήστη. 

Μέχρι πρότινος, η κύρια μέριμνα της επιστημονικής κοινότητας επικεντρωνόταν στην ανάπτυξη αλγορίθμων ικανών να απαντήσουν στο δυαδικό ερώτημα της γνησιότητας ή μη ενός video. Ωστόσο, μια νέα ερευνητική προσπάθεια από το Πανεπιστήμιο της Καλιφόρνια στο Riverside (UCR), η οποία υλοποιήθηκε σε στενή συνεργασία με επιστήμονες από το YouTube και τη Google DeepMind, έρχεται να μετατοπίσει το επίκεντρο της ψηφιακής εγκληματολογίας. Η ομάδα ανέπτυξε ένα εξειδικευμένο λογισμικό που υπερβαίνει την απλή ανίχνευση του deepfake υλικού, προσφέροντας τη δυνατότητα ταυτοποίησης του συγκεκριμένου συστήματος τεχνητής νοημοσύνης που χρησιμοποιήθηκε για την κατασκευή του.

Το σύστημα φέρει την ονομασία SAGA, ένα αρκτικόλεξο που προκύπτει από τον όρο "Source Attribution of Generative AI Videos", και αποτελεί μία από τις πρώτες μεγάλης κλίμακας προσπάθειες ιχνηλάτησης των συνθετικών βίντεο πίσω στην αρχική τους πηγή. Η συγκεκριμένη υλοποίηση καταγράφεται σε μια χρονική συγκυρία όπου η παραπληροφόρηση μέσω οπτικοακουστικών μέσων αυξάνεται ραγδαία, επηρεάζοντας τομείς όπως η πολιτική σκηνή, η διαφήμιση και η ενημέρωση στα κοινωνικά δίκτυα.

Πώς λειτουργεί το εργαλείο SAGA και ποια AI μοντέλα αναγνωρίζει;

Το SAGA είναι ένα νέο λογισμικό που αναλύει χωρικές λεπτομέρειες και χρονικές μεταβολές στα μεμονωμένα καρέ ενός βίντεο, εντοπίζοντας τα μοναδικά «δακτυλικά αποτυπώματα» που αφήνουν ακούσια τα AI εργαλεία. Έχει δοκιμαστεί με επιτυχία σε 19 διαφορετικά μοντέλα τεχνητής νοημοσύνης, διαχωρίζοντας αξιόπιστα τα βίντεο που προέρχονται από αρχικό κείμενο (text-to-video) σε σχέση με εκείνα που βασίζονται σε ακίνητη εικόνα (image-to-video).

Για να κατανοήσουμε την αρχιτεκτονική του SAGA, είναι απαραίτητο να διαχωρίσουμε τη φύση των βίντεο από εκείνη των στατικών εικόνων. Τα βίντεο εμπεριέχουν κίνηση και χρονική πληροφορία, γεγονός που σημαίνει ότι τα οπτικά στοιχεία μεταβάλλονται διαρκώς από το ένα καρέ στο επόμενο. Οι διαφορετικές γεννήτριες τεχνητής νοημοσύνης, στην προσπάθεια τους να αποδώσουν αυτή τη χρονική συνέχεια, παράγουν ανεπαίσθητες παραλλαγές και τεχνικές ατέλειες κατά τη διάρκεια αυτών των μεταβάσεων, δημιουργώντας διακριτά μοτίβα. Αντί το σύστημα να εξετάζει ένα μεμονωμένο καρέ αναζητώντας στατικά σφάλματα, το SAGA μελετά τον τρόπο με τον οποίο η οπτική πληροφορία εξελίσσεται και ρέει μέσα στον χρόνο.

Η βασική καινοτομία που επιτρέπει αυτή τη διαδικασία ονομάζεται "Temporal Attention Signatures" (T-Sigs). Οι συγκεκριμένες ψηφιακές υπογραφές οπτικοποιούν τα μοναδικά μοτίβα που συνδέονται με διαφορετικές γεννήτριες βίντεο. Υπολογίζοντας τον μέσο όρο των μοτίβων σε ένα μεγάλο δείγμα βίντεο που έχουν παραχθεί από το ίδιο σύστημα AI, το λογισμικό δημιουργεί ένα χαρακτηριστικό προφίλ που βοηθά στη σαφή διάκριση της μιας γεννήτριας από την άλλη. Το σύστημα είναι πλέον σε θέση να επιβεβαιώσει εάν ένα βίντεο είναι πραγματικό ή συνθετικό, να αναγνωρίσει την αρχική μέθοδο δημιουργίας του, να διακρίνει διαφορετικές εκδόσεις των υποκείμενων μοντέλων AI, ακόμα και να υποδείξει την ομάδα ανάπτυξης που βρίσκεται πίσω από τον εκάστοτε κώδικα.

Γιατί η ανίχνευση της πηγής των deepfakes είναι ζωτικής σημασίας για την κυβερνοασφάλεια

Ο επικεφαλής της έρευνας, υποψήφιος διδάκτορας του UCR Rohit Kundu, υπό την καθοδήγηση του καθηγητή Amit Roy-Chowdhury (συνδιευθυντή του Ινστιτούτου RAISE), επισημαίνει ότι τα ίχνη που αφήνουν τα παραγωγικά μοντέλα λειτουργούν ακριβώς όπως τα δακτυλικά αποτυπώματα, καταλήγοντας στο συμπέρασμα ότι αυτές οι υπογραφές διαφέρουν σαφώς μεταξύ των διάφορων συστημάτων. Ωστόσο, η χρησιμότητα αυτής της ανακάλυψης ξεπερνά το ακαδημαϊκό ενδιαφέρον. Καθώς τα εργαλεία παραγωγής βίντεο καθίστανται ευρέως διαθέσιμα, η διαπίστωση ότι ένα βίντεο είναι ψευδές συχνά δεν προσφέρει επαρκή λύση στο ευρύτερο πρόβλημα της διαδικτυακής εξαπάτησης.

Η ικανότητα αναγνώρισης της ακριβούς πηγής περιεχομένου τεχνητής νοημοσύνης παρέχει στους ψηφιακούς ερευνητές τα απαραίτητα εργαλεία για να παρακολουθήσουν οργανωμένες εκστρατείες παραπληροφόρησης με μεγάλη ακρίβεια. Επιπλέον, διευκολύνει τις ρυθμιστικές αρχές στην επιβολή των απαιτήσεων διαφάνειας που προβλέπονται από τα νέα νομοθετικά πλαίσια, ενώ ταυτόχρονα βοηθά τις ίδιες τις τεχνολογικές εταιρείες να κατανοήσουν τη διαδρομή και τον ρυθμό εξάπλωσης των συνθετικών μέσων στις πλατφόρμες τους. Οι ερευνητές αναγνωρίζουν ότι η συγκεκριμένη διαδικασία αποτελεί ένα διαρκές «παιχνίδι γάτας και ποντικιού», καθώς οι δημιουργοί των AI μοντέλων βελτιώνουν συνεχώς τους αλγορίθμους τους για να εξαλείψουν αυτά τα ίχνη, όμως η δομική λειτουργία των T-Sigs καθιστά την πλήρη απόκρυψη της προέλευσης εξαιρετικά δυσχερή.

Η άποψη του Techgear

Η ικανότητα να δείχνουμε με το δάχτυλο όχι μόνο το deepfake υλικό, αλλά και το λογισμικό που το παρήγαγε, αποτελεί ένα κομβικό βήμα για τη θωράκιση του διαδικτυακού οικοσυστήματος, ειδικά εάν εξετάσουμε τις προεκτάσεις στην ελληνική αγορά και κοινωνία. Εδώ και αρκετούς μήνες καταγράφεται εκθετική αύξηση σε στοχευμένες απάτες (scams) στα μέσα κοινωνικής δικτύωσης, όπου πρωταγωνιστούν παραποιημένα βίντεο διάσημων Ελλήνων προσώπων, πολιτικών και δημοσιογράφων, τα οποία προτρέπουν τους χρήστες σε ανύπαρκτες επενδύσεις κρυπτονομισμάτων. Οι εγχώριες αρχές δίωξης ηλεκτρονικού εγκλήματος συχνά βρίσκονται εγκλωβισμένες στην προσπάθεια εντοπισμού των δραστών, καθώς η πηγή του οπτικοακουστικού υλικού παραμένει καλά κρυμμένη.

Ενσωματώνοντας συστήματα όπως το SAGA σε επίπεδο υποδομής από τις ίδιες τις πλατφόρμες διανομής περιεχομένου, η ερευνητική διαδικασία αποκτά μια εντελώς νέα διάσταση. Η δυνατότητα να ταυτοποιηθεί, για παράδειγμα, ότι ένα απατηλό βίντεο που κυκλοφορεί στο ελληνικό Facebook δημιουργήθηκε από μια συγκεκριμένη έκδοση ανοιχτού κώδικα ενός image-to-video μοντέλου, προσφέρει πολύτιμα ψηφιακά ίχνη για την αποδόμηση των δικτύων παραπληροφόρησης. Δεν αναφερόμαστε πλέον απλώς στην ικανότητα να διακρίνουμε την αλήθεια από το κατασκευασμένο υλικό, αλλά στην απόκτηση της τεχνικής ωριμότητας να εντοπίζουμε τις συντεταγμένες της ίδιας της απάτης, προσθέτοντας ένα κρίσιμο στρώμα τεχνικής ιχνηλασιμότητας και λογοδοσίας.

Loading