Google Frozen v2: Το νέο εξειδικευμένο chip που δεκαπλασιάζει την απόδοση του Gemini

Add as preferred source on Google

Σύνοψη

  • Η Google αναπτύσσει το νέο AI server chip με την κωδική ονομασία Frozen v2, στοχεύοντας στην ανάπτυξή του εντός των data centers το 2028.
  • Ενσωματώνει την αρχιτεκτονική των μοντέλων Gemini απευθείας στο hardware, εγκαταλείποντας την πλήρη ευελιξία για χάρη της απόλυτης ταχύτητας.
  • Υπόσχεται έξι έως δέκα φορές μεγαλύτερη ενεργειακή απόδοση κατά το AI inference, μετρούμενη σε παραγόμενα AI tokens ανά Watt.
  • Έρχεται ως απάντηση στην οξεία έλλειψη υπολογιστικών πόρων, η οποία φέρεται να οδήγησε το Google Cloud στην απόρριψη νέων εταιρικών πελατών.
  • Το Frozen v2 δεν θα αντικαταστήσει τους επεξεργαστές TPU (Tensor Processing Units), αλλά θα δημιουργήσει έναν νέο, απολύτως εξειδικευμένο κλάδο στο custom hardware της Alphabet.

Το τοπίο της τεχνητής νοημοσύνης απαιτεί πρωτοφανή επίπεδα υπολογιστικής ισχύος, και το κόστος λειτουργίας των Μεγάλων Γλωσσικών Μοντέλων (LLMs) έχει αρχίσει να πιέζει ασφυκτικά τις υποδομές των κολοσσών της τεχνολογίας

Σύμφωνα με πρόσφατες αναφορές, η Google σχεδιάζει να αλλάξει ριζικά τον τρόπο με τον οποίο εκτελούνται τα μοντέλα της, μεταφέροντας την αρχιτεκτονική του Gemini από το επίπεδο του λογισμικού, κατευθείαν στον πυρήνα του hardware. Το project, γνωστό εσωτερικά ως «Frozen v2», αναδεικνύει τις ακραίες μηχανικές λύσεις που απαιτούνται για να καταστεί βιώσιμη η λειτουργία της τεχνητής νοημοσύνης σε παγκόσμια κλίμακα, ξεφεύγοντας από τους παραδοσιακούς επεξεργαστές γενικής χρήσης.

Τι είναι το νέο AI chip Frozen v2 της Google;

Το Frozen v2 είναι το νέο εξειδικευμένο server chip της Google, το οποίο ενσωματώνει την αρχιτεκτονική των μοντέλων τεχνητής νοημοσύνης Gemini απευθείας στο κύκλωμα πυριτίου. Με προγραμματισμένη κυκλοφορία το 2028, υπόσχεται έξι έως δέκα φορές υψηλότερη ενεργειακή απόδοση στην παραγωγή AI tokens σε σχέση με τους σημερινούς Tensor Processing Units (TPUs).

Η βασική αρχή λειτουργίας των σημερινών AI accelerators βασίζεται στη συνεχή μεταφορά δεδομένων μεταξύ της ταχύτατης μνήμης HBM (High Bandwidth Memory) και των υπολογιστικών πυρήνων. Αυτή η διαδικασία διαρκούς ανταλλαγής δεδομένων, καταναλώνει τεράστια ποσά ενέργειας και προσθέτει ανεπιθύμητη καθυστέρηση. Το Frozen v2 επιλύει αυτό το κατασκευαστικό πρόβλημα μετατρέποντας τον ίδιο τον σχεδιασμό του νευρωνικού δικτύου σε φυσικό κύκλωμα.

Η λέξη "Frozen" δεν επιλέχθηκε τυχαία, καθώς η δομή του chip «κλειδώνει» πάνω στον σχεδιασμό του Gemini. Ενώ οι μηχανικοί της Google θα διατηρούν τη δυνατότητα να ενημερώνουν τα «βάρη» του μοντέλου, η θεμελιώδης αρχιτεκτονική παραμένει σταθερή και χυτευμένη στο μέταλλο. Αυτή η θυσία της ευελιξίας επιτρέπει την εξάλειψη τεράστιου όγκου περιττών υπολογισμών, καθιστώντας την εκτέλεση εντολών άμεση, εξαιρετικά γρήγορη και με δραματικά χαμηλότερο ενεργειακό αποτύπωμα.

Βασικά χαρακτηριστικά της φιλοσοφίας Frozen:

    • Κατάργηση της ανάγκης για υπερβολικά μεγάλο bandwidth μνήμης κατά το inference.
    • Απευθείας hardcoding των νευρωνικών διαδρομών του Gemini.
    • Μείωση του ενεργειακού κόστους ανά παραγόμενο AI token κατά 60% έως 90%.

Γιατί η Google προχωρά στην ανάπτυξη του Frozen v2;

Η κίνηση απαντά στην οξεία έλλειψη υπολογιστικών πόρων που αντιμετωπίζει εσωτερικά η Google, η οποία οδήγησε το Google Cloud στο να απορρίψει συμφωνίες με εξωτερικούς πελάτες. Ταυτόχρονα, η ραγδαία αύξηση του κόστους λειτουργίας LLMs καθιστά επιτακτική την απεξάρτηση από ενεργοβόρους επεξεργαστές γενικής χρήσης.

Η πίεση στις υποδομές της Google είναι τεράστια. Παρά το γεγονός ότι η εταιρεία αναπτύσσει το δικό της custom hardware (TPUs), οι απαιτήσεις του οικοσυστήματος Gemini για λειτουργίες εκπαίδευσης και εξαγωγής συμπερασμάτων εξαντλούν τις διαθέσιμες δυνατότητες των data centers. Είναι ενδεικτικό ότι, σύμφωνα με αναφορές, η Google υποχρεώθηκε να συνάψει συμφωνία ύψους περίπου 1 δισεκατομμυρίου δολαρίων μηνιαίως με τη SpaceX τον περασμένο μήνα, προκειμένου να ανταπεξέλθει στις υποχρεώσεις παροχής cloud υπολογιστικής ισχύος προς μεγάλους εταιρικούς πελάτες.

Στο τρέχον τεχνολογικό τοπίο, η απόδοση μετράται σε Watt. Η ενσωμάτωση του Gemini στο Google Search, στο Workspace και στο Android σημαίνει ότι το μοντέλο εξυπηρετεί δισεκατομμύρια αιτήματα καθημερινά. Κάθε Joule ενέργειας που εξοικονομείται μεταφράζεται σε εκατομμύρια δολάρια μειωμένου λειτουργικού κόστους. Παράλληλα, ο ανταγωνισμός από εταιρείες όπως η OpenAI, η Anthropic, αλλά και ισχυρά κινεζικά μοντέλα (όπως της Alibaba και της Moonshot AI, τα οποία καταλαμβάνουν πλέον σχεδόν το 45% της χρήσης AI tokens σε αμερικανικές επιχειρήσεις), επιβάλλει στην Alphabet να βρει έναν τρόπο να προσφέρει κορυφαίες AI υπηρεσίες σε ένα κλάσμα του κόστους των ανταγωνιστών της.

Ποιες είναι οι διαφορές μεταξύ Frozen v2 και TPUs;

Σε αντίθεση με τους επεξεργαστές TPU που σχεδιάστηκαν για να διαχειρίζονται πληθώρα διαφορετικών διεργασιών μηχανικής μάθησης, το Frozen v2 αφορά αποκλειστικά το Gemini. Δεν θα αντικαταστήσει τους TPUs, αλλά θα λειτουργήσει συμπληρωματικά, αναλαμβάνοντας εστιασμένα το inference με ασύγκριτα χαμηλότερη κατανάλωση.

Η οικογένεια των Tensor Processing Units αποτελεί τη ραχοκοκαλιά της υποδομής της Google τα τελευταία χρόνια. Οι TPUs είναι Application-Specific Integrated Circuits (ASICs), βελτιστοποιημένοι για πράξεις τανυστών, ωστόσο διατηρούν την ευελιξία να εκπαιδεύουν και να τρέχουν πολλαπλά, διαφορετικά μοντέλα μηχανικής μάθησης. Το Frozen v2 πάει την εξειδίκευση στο απόλυτο άκρο. Η διαφορά τους εντοπίζεται στη γενικότητα: Ο TPU είναι το «εργοστάσιο» που μπορεί να φτιάξει οποιοδήποτε αυτοκίνητο, ενώ το Frozen v2 είναι η αποκλειστική γραμμή παραγωγής ενός και μόνο οχήματος.

Η ιδέα αυτή δεν είναι απολύτως μοναδική στην ευρύτερη αγορά. Ήδη startups όπως η Taalas αναπτύσσουν chips στα οποία «τυπώνουν» τα βάρη και την αρχιτεκτονική ενός μοντέλου απευθείας στο hardware. Η Taalas υποστηρίζει ότι τα δικά της εξειδικευμένα κυκλώματα μπορούν να επεξεργαστούν έως και 17.000 tokens ανά δευτερόλεπτο, τη στιγμή που μια κορυφαία GPU της Nvidia προσφέρει περίπου 150 tokens ανά χρήστη. Εάν η Google καταφέρει να εφαρμόσει αυτή τη λογική στην τεράστια κλίμακα των δικών της data centers, θα αποκτήσει ένα αδιανόητο πλεονέκτημα απέναντι σε όσους εξαρτώνται αποκλειστικά από τις εμπορικές, ευέλικτες αλλά εξαιρετικά δαπανηρές λύσεις της Nvidia.

Πώς η αρχιτεκτονική Frozen επηρεάζει την ελληνική αγορά;

Για τις ελληνικές επιχειρήσεις που αξιοποιούν το Google Cloud, η κυκλοφορία του Frozen v2 μεταφράζεται μελλοντικά σε δραστικά ταχύτερη απόκριση (χαμηλότερο latency) των AI εφαρμογών και δυνητικά κατακόρυφη μείωση στο κόστος χρήσης API.

Η ελληνική αγορά enterprise cloud παρουσιάζει δυναμική ανάπτυξη, με τράπεζες, τηλεπικοινωνιακούς παρόχους και μεγάλες εταιρείες retail να ενσωματώνουν σταδιακά λύσεις τεχνητής νοημοσύνης για την εξυπηρέτηση πελατών και την ανάλυση δεδομένων. Αυτή τη στιγμή, το υψηλό κόστος χρέωσης (ανά 1.000 tokens) στο API του Gemini Pro ή του Gemini Ultra καθιστά απαγορευτική την ευρεία ανάπτυξη του σε εγχώριες μικρομεσαίες επιχειρήσεις με περιορισμένα budget ψηφιακού μετασχηματισμού.

Εφόσον το Frozen v2 μειώσει το κόστος λειτουργίας του οικοσυστήματος κατά 6 έως 10 φορές, η Google θα μπορέσει να μετακυλήσει μέρος αυτής της εξοικονόμησης στους πελάτες του Google Cloud. Αυτό θα επέτρεπε στις ελληνικές εταιρείες να ενσωματώσουν high-end μοντέλα τεχνητής νοημοσύνης με κόστος συνδρομής σε ευρώ που ανταποκρίνεται στα μεγέθη της τοπικής αγοράς. Επιπλέον, το hardware-based inference εκμηδενίζει σχεδόν την καθυστέρηση. Στην περίπτωση των φωνητικών βοηθών στα ελληνικά, όπου η πολυπλοκότητα της γλώσσας σε συνδυασμό με την απόσταση από τα κεντρικά data centers της Ευρώπης προσθέτει χρονοκαθυστέρηση, μια τέτοια αναβάθμιση στην υποδομή θα επέτρεπε απολύτως φυσική, real-time αλληλεπίδραση.

Loading