![]()
Η κινεζική εταιρεία τεχνητής νοημοσύνης DeepSeek ισχυρίζεται τώρα ότι εκπαίδευσε το μοντέλο R1 που επικεντρώνεται στη συλλογιστική για μόλις 294.000 δολάρια, αποκαλύπτοντας το ποσό για πρώτη φορά σε μια εργασία που αξιολογήθηκε από ομότιμους στο Nature. Η εταιρεία αναφέρει ότι η εκπαίδευση διήρκεσε 80 ώρες σε ένα σύμπλεγμα 512 τσιπ Nvidia H800 που έχουν σχεδιαστεί για την Κίνα.
Το κόστος είναι χαμηλότερο από τα εννιαψήφια ποσά που συχνά επικρατούσαν στον αγώνα της τεχνητής νοημοσύνης στις ΗΠΑ. Ο Διευθύνων Σύμβουλος της OpenAI, Σαμ Άλτμαν, έχει δηλώσει στο παρελθόν ότι η «εκπαίδευση βασικών μοντέλων» κοστίζει «πολύ περισσότερο» από 100 εκατομμύρια δολάρια, χωρίς να δώσει λεπτομερείς αναλύσεις.
Η DeepSeek παραδέχτηκε επίσης σε συμπληρωματικό υλικό ότι κατέχει τις GPU Nvidia A100 και τις χρησιμοποίησε σε προπαρασκευαστικό στάδιο πριν από την εκτέλεση της εκπαίδευσης R1 στα H800. Αυτή η διαφάνεια έρχεται μετά από μήνες ελέγχου σχετικά με το εάν η νεοσύστατη εταιρεία είχε πρόσβαση σε περιορισμένα τσιπ H100 παρά τους ελέγχους εξαγωγών των ΗΠΑ. Η DeepSeek αρνείται ότι χρησιμοποίησε H100. Αμερικανοί αξιωματούχοι ισχυρίστηκαν ότι η εταιρεία βρήκε τρόπους για να έχει πρόσβαση σε αυτά μέσω εταιρειών-κελύφη στη Νοτιοανατολική Ασία.
Η αποκάλυψη έρχεται καθώς το DeepSeek απολαμβάνει σπάνιας προβολής: η εργασία του R1 έγινε εξώφυλλο του Nature, και η δημοσίευση περιγράφει μια προσέγγιση με προτεραιότητα την ενισχυτική μάθηση για την ενίσχυση της «συλλογιστικής» χωρίς τεράστιους προϋπολογισμούς προεκπαίδευσης. Αυτή η τεχνική οπτική γωνία -σε συνδυασμό με την τιμή των 294.000 δολαρίων- θα αναζωπυρώσει τις συζητήσεις σχετικά με το εάν οι πιο έξυπνες μέθοδοι εκπαίδευσης μπορούν να ξεπεράσουν την καθαρή υπολογιστική κλίμακα.
Οι σκεπτικιστές θα λάβουν υπόψη τι περιλαμβάνει το ποσό – και τι δεν περιλαμβάνει. Το «κόστος εκπαίδευσης» αναφέρεται συνήθως στην κύρια υπολογιστική εκτέλεση και όχι σε μήνες επιμέλειας δεδομένων, μισθούς μηχανικών ή προηγούμενα πειράματα. Το 80ωρο σπριντ H800 μπορεί να είναι ακριβές για την τελική προσπάθεια, ενώ παράλληλα καλύπτει ένα μεγαλύτερο συνολικό κόστος Έρευνας και Ανάπτυξης.
Ακόμα κι έτσι, το μήνυμα είναι σαφές: εάν μπορεί να προταθεί ένα ανταγωνιστικό μοντέλο συλλογισμού για χαμηλά εξαψήφια έξοδα άμεσης εκπαίδευσης, οι ήδη υπάρχοντες φορείς που στοιχηματίζουν μόνο σε μεγαλύτερα clusters θα μπορούσαν να αντιμετωπίσουν πίεση στο περιθώριο κέρδους – και οι επενδυτές θα συνεχίσουν να ρωτούν εάν οι μεγαλύτεροι προϋπολογισμοί εξακολουθούν να αγοράζουν τα μεγαλύτερα πλεονεκτήματα. Αυτή η συζήτηση είχε ήδη αναστατώσει τις αγορές νωρίτερα φέτος, όταν η χαμηλού κόστους πρόταση της DeepSeek έγινε για πρώτη φορά γνωστή.








