Σύνοψη
- Εκτενής έρευνα του Πανεπιστημίου της Κοπεγχάγης σε 27 μεγάλα γλωσσικά μοντέλα (LLMs) και 70 εκατομμύρια παραγόμενες απαντήσεις αποκαλύπτει σοβαρή μείωση στην ποικιλομορφία της παρεχόμενης πληροφορίας.
- Ακόμα και τα πιο εξελιγμένα συστήματα, όπως οι νεότερες εκδόσεις του ChatGPT, προσφέρουν σχεδόν 19% λιγότερο διαφοροποιημένες απαντήσεις συγκριτικά με τα οργανικά αποτελέσματα του Google Search.
- Οι επιστήμονες προειδοποιούν για το φαινόμενο της «Γνωστικής Κατάρρευσης» (Knowledge Collapse), καθώς η διαρκής κατανάλωση ομογενοποιημένης πληροφορίας ανακυκλώνει διαρκώς τις ίδιες, επικρατούσες απόψεις.
- Η κυριαρχία της αγγλικής γλώσσας στα δεδομένα εκπαίδευσης περιθωριοποιεί την περιφερειακή γνώση, περιορίζοντας δραστικά την πρόσβαση σε αυθεντικές ελληνικές πηγές και τοπικό περιεχόμενο.
- Εντελώς ανέλπιστα για την τεχνολογική κοινότητα, τα μικρότερα σε μέγεθος μοντέλα καθώς και όσα ενσωματώνουν την τεχνολογία RAG (Retrieval-Augmented Generation) εμφανίζουν αισθητά καλύτερη πολυφωνία και αντοχή απέναντι στην αλγοριθμική στασιμότητα.
Η καθημερινή μας αλληλεπίδραση με την πληροφορία στο διαδίκτυο περνάει σταδιακά μέσα από το φίλτρο των Μεγάλων Γλωσσικών Μοντέλων (LLMs), καθώς οι πλατφόρμες παραγωγικής τεχνητής νοημοσύνης αναλαμβάνουν τον ρόλο του πρωταρχικού διαμεσολαβητή για την αναζήτηση απαντήσεων.
Μία πρόσφατη, εξαιρετικά αναλυτική έρευνα από το Τμήμα Επιστήμης Υπολογιστών του Πανεπιστημίου της Κοπεγχάγης (DIKU) έρχεται να αναδείξει την αθέατη πλευρά αυτής της ραγδαίας τεχνολογικής μετάβασης, τεκμηριώνοντας με ακλόνητα στατιστικά δεδομένα ότι η υπερβολική εξάρτηση από τα AI chatbots ενδέχεται να οδηγήσει την ανθρωπότητα προς μία συνθήκη απόλυτης πληροφοριακής ομογενοποίησης.
Τι είναι η Γνωστική Κατάρρευση (Knowledge Collapse) και πώς προκαλείται;
Η γνωστική κατάρρευση αποτελεί το φαινόμενο κατά το οποίο η πρόσβαση στην ανθρώπινη γνώση διαμεσολαβείται μαζικά από γλωσσικά μοντέλα (LLMs) που αναπαράγουν ένα στενό, αυστηρά οριοθετημένο σύνολο αντιλήψεων. Καθώς οι τελικοί χρήστες βασίζονται αποκλειστικά σε AI chatbots αντί για την παραδοσιακή περιήγηση στον ιστό, περιορίζεται δραστικά η έκθεσή τους σε πολυφωνικές απόψεις, εναλλακτικές θεωρίες και πρωτογενείς πηγές πληροφοριών.
Για να καταλήξουν στα συγκεκριμένα συμπεράσματα, οι επιστήμονες υλοποίησαν ίσως την πιο εκτεταμένη δοκιμή αξιολόγησης επιστημολογικής ποικιλομορφίας μέχρι σήμερα, αναλύοντας διεξοδικά τη συμπεριφορά 27 διαφορετικών συστημάτων τεχνητής νοημοσύνης πάνω σε 155 ξεχωριστά θεματικά πεδία. Η ερευνητική ομάδα τροφοδότησε τους αλγορίθμους με εκατοντάδες παραλλαγές προτροπών για να συγκεντρώσει περισσότερες από 70 εκατομμύρια μεμονωμένες απαντήσεις.
Τα βασικά τεχνικά ευρήματα της έρευνας συνοψίζονται στα εξής:
- Αξιολογήθηκαν συνολικά 27 κορυφαία μοντέλα AI παραγωγής κειμένου.
- Εντοπίστηκαν περισσότεροι από 70 εκατομμύρια διακριτοί ισχυρισμοί (claims) που ομαδοποιήθηκαν βάσει σημασιολογικής ισοδυναμίας.
- Η ανάλυση κάλυψε θέματα γεωγραφικού και πολιτισμικού ενδιαφέροντος σε 12 διαφορετικές χώρες.
- Καταγράφηκε η εξέλιξη της συμπεριφοράς των μοντέλων στον χρόνο, αποδεικνύοντας βελτίωση μεν, δραματική απόκλιση από τα πρότυπα αναζήτησης δε.
Η σύγκριση με την κλασική μηχανή αναζήτησης
Το πλέον αξιοσημείωτο στοιχείο που προκύπτει από την ανάλυση των ερευνητικών δεδομένων αφορά την άμεση σύγκριση της ποικιλομορφίας των απαντήσεων που παράγουν τα LLMs με τα οργανικά αποτελέσματα μιας τυπικής μηχανής αναζήτησης της Google. Ακόμα και κατά τη χρήση των πιο προηγμένων μοντέλων, οι ερευνητές διαπίστωσαν ότι οι πληροφορίες που παρουσιάζονται στους αναγνώστες είναι κατά 18,5% έως 19% λιγότερο διαφοροποιημένες σε σχέση με μια συμβατική διαδικτυακή αναζήτηση. Η εν λόγω ποσοτική διαφορά σημαίνει πρακτικά ότι τα AI chatbots τείνουν να ανακυκλώνουν συνεχώς τις ίδιες κυρίαρχες απόψεις, αγνοώντας δευτερεύουσες πηγές, εναλλακτικές ερμηνείες ή λιγότερο προβεβλημένα ακαδημαϊκά δεδομένα.
Σύμφωνα με την ακαδημαϊκή δημοσίευση, η συγκεκριμένη μεθοδολογία παραγωγής κειμένου δημιουργεί έναν επικίνδυνο φαύλο κύκλο. Το ήδη δημοφιλές περιεχόμενο εδραιώνεται σταδιακά ως η μοναδική αποδεκτή αλήθεια, ωθώντας οποιαδήποτε άλλη προσέγγιση στο περιθώριο της ψηφιακής λήθης. Η καθηγήτρια Isabelle Augenstein παρομοιάζει εύστοχα την εξέλιξη των LLMs με τις αρνητικές επιπτώσεις της παγκοσμιοποίησης στο φυσικό εμπόριο, όπου η τεράστια ευκολία οδήγησε τελικά στην πλήρη κυριαρχία των ίδιων πολυεθνικών αλυσίδων έναντι της τοπικής, ποιοτικής επιχειρηματικότητας.
Πώς επηρεάζεται η τοπική γνώση και το ελληνικό ψηφιακό περιβάλλον
Τα μεγάλα γλωσσικά μοντέλα δίνουν συστηματικά προτεραιότητα στα τεράστια αγγλόφωνα σύνολα δεδομένων εκπαίδευσης, υποβαθμίζοντας την περιφερειακή γνώση. Για αγορές όπως η Ελλάδα, η παραγόμενη πληροφορία από τα chatbots αγνοεί τακτικά τις ντόπιες πηγές, τις πολιτισμικές αποχρώσεις και τα εξειδικευμένα ελληνικά κείμενα, βασιζόμενη σχεδόν αποκλειστικά σε αυτοματοποιημένες μεταφράσεις δυτικών προτύπων.
Η γλωσσική και πολιτισμική μεροληψία των σύγχρονων μοντέλων συνιστά ίσως την πιο κρίσιμη παράμετρο για την εγχώρια αγορά και ευρύτερα για τα κράτη που δεν ανήκουν στον αγγλοσαξονικό άξονα. Όπως επισημαίνει η ερευνητική εργασία, τα δεδομένα πάνω στα οποία έχουν εκπαιδευτεί τα κορυφαία συστήματα της OpenAI, της Google και της Anthropic προέρχονται συντριπτικά από αγγλόφωνα websites. Όταν συνεπώς ένας Έλληνας χρήστης αναζητά πληροφορίες για εγχώρια ιστορικά γεγονότα, εξειδικευμένα νομικά ζητήματα ή αναλύσεις της τοπικής αγοράς τεχνολογίας, ο αλγόριθμος δεν αντλεί πρωτογενώς από τα αξιόπιστα ελληνικά αρχεία. Αντιθέτως, συνθέτει περιλήψεις βασισμένες στην αγγλική Wikipedia και σε κείμενα αμερικανικής κυρίως νοοτροπίας.
Η ανάγκη για ψηφιακή εκπροσώπηση γίνεται άμεσα αντιληπτή εάν αναλογιστεί κανείς τη χρήση της τεχνητής νοημοσύνης στο εκπαιδευτικό σύστημα ή στην καθημερινή επαγγελματική έρευνα εντός Ελλάδας. Η περιθωριοποίηση των τοπικών μέσων ενημέρωσης στερεί από τον τελικό καταναλωτή το απαραίτητο πολιτισμικό πλαίσιο και ακυρώνει την προσπάθεια των δημιουργών περιεχομένου να αναδείξουν τη δουλειά τους.
Τα τεχνικά παράδοξα: Μέγεθος μοντέλων και τεχνολογία RAG
Μέσα από έρευνα του Πανεπιστημίου της Κοπεγχάγης, οι συγγραφείς εντόπισαν ορισμένα ιδιαιτέρως απροσδόκητα δομικά χαρακτηριστικά σχετικά με την αρχιτεκτονική των τεχνητών νευρωνικών δικτύων. Σε πλήρη αντίθεση με την κοινή αντίληψη της βιομηχανίας που υποστηρίζει πως τα ογκωδέστερα μοντέλα με τις εκατοντάδες δισεκατομμύρια παραμέτρους είναι ικανότερα σε όλα τα επίπεδα, η μαθηματική ανάλυση αποδεικνύει ότι τα μικρότερα σε μέγεθος μοντέλα καταφέρνουν να διατηρήσουν υψηλότερα επίπεδα γνωστικής πολυφωνίας. Η επιθετική βελτιστοποίηση και η αυστηρή ευθυγράμμιση των υπερ-μοντέλων, στην προσπάθεια των εταιρειών να ελαχιστοποιήσουν τις παραισθήσεις, καταλήγουν να «στραγγαλίζουν» εντελώς τη δημιουργικότητα.
Επιπλέον, η εφαρμογή της τεχνικής Retrieval-Augmented Generation (RAG) αναδεικνύεται ως ο πιο αποτελεσματικός μηχανισμός άμυνας ενάντια στην αλγοριθμική στασιμότητα. Το σύστημα RAG εξαναγκάζει το γλωσσικό μοντέλο να παραθέσει εξωτερικές πηγές, ελέγχοντας ζωντανά τις διαθέσιμες πληροφορίες του ιστού τη στιγμή του αιτήματος. Παρά ταύτα, η αποτελεσματικότητα των μηχανισμών αναζήτησης λειτουργεί άριστα για την άντληση αμερικανικών άρθρων, αλλά υστερεί χαρακτηριστικά στον εντοπισμό ποιοτικών πηγών σε γλώσσες με μικρότερο ψηφιακό αποτύπωμα, όπως η ελληνική.
Διαβάστε επίσης