Bạn đã bao giờ đọc một tiêu đề khiến bạn phải dừng lại chưa? "Moonshot AI công bố mô hình Kimi K3 với 2,8 nghìn tỷ tham số, thách thức sự thống trị của Mỹ về AI". Bài viết xuất hiện trên Crypto Briefing, một trang tin yêu thích của giới đầu tư bán lẻ. Tôi, Lý Hiếu, một người đã dành gần một thập kỷ xây dựng cộng đồng Web3 và nghiên cứu cả blockchain lẫn AI, đọc xong chỉ có thể lắc đầu. Không phải vì tôi ghét Moonshot AI – tôi thực sự ngưỡng mộ đội ngũ đó – mà vì cách câu chuyện được đóng gói quá hoàn hảo để phục vụ một mục đích duy nhất: PR.

Hãy cùng giải mã. 2,8 nghìn tỷ tham số – con số đó đồng nghĩa với việc mô hình này sẽ là mô hình dày đặc (dense) lớn nhất từng được biết đến, lớn hơn GPT-4 khoảng 50% và lớn hơn Llama 3 405B tới 6 lần. Nhưng liệu một startup Trung Quốc với tổng vốn huy động được chỉ khoảng 1,5 tỷ USD có thể chi trả cho một cụm GPU để huấn luyện mô hình như vậy? Câu trả lời là không. Từ kinh nghiệm audit nhiều dự án AI và blockchain của tôi, tôi biết rằng huấn luyện một mô hình 2,8 nghìn tỷ tham số dense sẽ tiêu tốn hàng tỷ USD và hàng nghìn GPU H100 chạy liên tục trong nhiều tháng. Ngay cả tập đoàn Meta cũng không dám khẳng định điều này với Llama 3.
Sự thật tinh tế hơn nhiều. Tôi cá rằng 2,8 nghìn tỷ đó là tổng tham số của một mô hình MoE (Mixture of Experts), trong đó chỉ một phần nhỏ tham số được kích hoạt cho mỗi token. DeepSeek-V2 cũng có tổng tham số tương tự (khoảng 2,8 nghìn tỷ) nhưng tham số kích hoạt chỉ khoảng 400 tỷ. Moonshot AI đã cố tình bỏ qua cụm từ "thông số kích hoạt" hoặc "mô hình thưa" trong thông báo của họ. Điều này không sai về mặt kỹ thuật, nhưng hoàn toàn gây hiểu lầm cho những người không chuyên. Còn về chi phí? Họ tuyên bố "chi phí chỉ bằng một phần nhỏ so với đối thủ Mỹ". Nếu là mô hình MoE với từ 400 tỷ tham số kích hoạt, chi phí huấn luyện thực tế có thể chỉ vào khoảng 50-100 triệu USD – thấp hơn GPT-4 khoảng 5-10 lần. Nhưng đó vẫn là một khoản tiền khổng lồ, và việc đặt cạnh cụm từ "chi phí cực thấp" là trò chơi chữ có chủ đích.
Sao điều này lại quan trọng với cộng đồng crypto? Bởi vì chúng ta đã từng thấy kịch bản tương tự: những dự án DeFi với APY không tưởng, những blockchain hứa hẹn TPS hàng triệu, hoặc những ICO với whitepaper đẹp như mơ. Những tuần vừa qua, khi thị trường đang trong giai đoạn downtrend, các nhà đầu tư đổ xô tìm kiếm câu chuyện mới để giữ vững niềm tin. Một AI Trung Quốc đột phá là thứ họ cần nghe. Crypto Briefing biết điều đó, và bài báo của họ đã được thiết kế tinh vi để thu hút sự chú ý mà không cần cung cấp bất kỳ bằng chứng độc lập nào.
Nhưng không sao, chúng ta có thể tự kiểm chứng. Trước tiên, hãy chờ Moonshot AI phát hành báo cáo kỹ thuật (technical report) với kiến trúc chi tiết. Thứ hai, tìm kiếm điểm chuẩn độc lập trên MMLU, HumanEval, hay C-Eval. Moonshot AI trước đây đã chứng minh được năng lực trong lĩnh vực ngữ cảnh dài (200k token), nhưng chưa từng đứng đầu bảng xếp hạng tổng thể. Thứ ba, nếu họ sử dụng MoE, hãy hỏi họ tỷ lệ kích hoạt (activation ratio) là bao nhiêu. Đây là những câu hỏi mà bất kỳ ai trong ngành AI đều có thể hỏi, nhưng dường như bị bỏ qua trong cơn sốt crypto.
Bài học cho chúng ta: thị trường giảm điểm là lúc niềm tin bị thử thách, và những câu chuyện đẹp đẽ thường dễ bị phóng đại. Các dự án Web3 về tính toán phi tập trung (Render, Akash, io.net) thường được hưởng lợi từ những câu chuyện như vậy, nhưng cũng dễ bị tổn thương khi sự thật lộ diện. Đừng để bản thân bị đánh lừa bởi con số ấn tượng. Hãy đào sâu vào kiến trúc, tính kinh tế và bằng chứng kiểm toán. Chỉ có như vậy, chúng ta mới có thể phân biệt được giữa một bước đột phá thực sự và một chiến dịch marketing thông minh.
Khi tuyên bố tiếp theo từ một dự án crypto hay AI xuất hiện, hãy dừng lại. Tắt cảm xúc. Bật tư duy phản biện. Và nhớ: 2,8 nghìn tỷ tham số có thể chỉ là 400 tỷ tham số, và một câu chuyện vĩ đại không tự nhiên sinh ra sự thật. Nó cần được kiểm chứng.