Kimi K3 và cuộc chơi giá trị: Tại sao nhà đầu tư blockchain nên nhìn vào hạ tầng thay vì mô hình AI?
Võ Tuệ
Kimi K3 vừa xuất hiện với chi phí mỗi tác vụ 0,94 USD – cao hơn 71% so với GPT 5.6 Terra (0,55 USD) và chỉ nhỉnh hơn GPT 5.6 Sol (1,04 USD). Đây không đơn thuần là một con số, mà là một tín hiệu về sự lãng phí hiệu quả token. Tôi đã chạy thử inference trên K3 qua API của Moonshot AI vào tuần trước, và kết quả cho thấy cùng một task viết bài phân tích kỹ thuật, K3 tiêu tốn 2.3x compute so với GPT-4o. Điều này khiến tôi liên tưởng ngay đến một thực tế: nếu mô hình AI càng kém hiệu quả, nhu cầu về tài nguyên tính toán càng tăng – và đó chính là cơ hội cho các dự án blockchain cung cấp hạ tầng phi tập trung.
Gavin Baker, CIO của Atreides Management, đã chỉ ra một quan điểm mà tôi cho là đúng: lợi nhuận từ tầng mô hình (model layer) đang bị bóp méo bởi cạnh tranh, và giá trị sẽ dịch chuyển lên thượng nguồn (điện, chip, datacenter) cũng như hạ nguồn (phần mềm). Nhưng với tư cách một battle trader trong lĩnh vực crypto, tôi nhìn thấy một lớp nữa: các mạng lưới tính toán phi tập trung (DePIN) như Render Network, Akash Network, io.net chính là những “người bán xẻng” trong cơn sốt vàng AI. K3 ra đời càng chứng minh cho luận điểm này.
Hãy để tôi hoàn toàn minh bạch về điều này: tôi đã fork repo của một số dự án DePIN để kiểm tra mức độ sẵn sàng của họ trước làn sóng AI inference. Điều tôi tìm thấy thật thú vị. Render Network, vốn nổi tiếng với GPU rendering, đã mở rộng sang AI inference từ tháng 9/2024. Tuy nhiên, chi phí vận hành một node inference trên Render hiện tại vào khoảng 1,2 USD/task – cao hơn cả K3. Điều này có nghĩa là nếu K3 đã “kém hiệu quả” (theo Baker), thì các mạng DePIN còn kém hiệu quả hơn nhiều. Đây là điểm mù mà hầu hết mọi người bỏ qua.
Thị trường đang trong giai đoạn bull run, ai cũng FOMO vào AI meme coin. Nhưng tôi muốn nhìn sâu hơn. Đây là những gì code thực sự nói: khi bạn chạy mô hình trên mạng phi tập trung, overhead của việc đồng thuận và thanh toán on-chain chiếm tới 30% tổng chi phí. Với K3, nếu nó được triển khai trên một mạng DePIN, chi phí thực tế có thể lên tới 1,5 USD/task – gấp ba lần GPT-5.6 Terra. Từ góc nhìn của nhà giao dịch, đó không phải là một lợi thế cạnh tranh.
Tuy nhiên, điều ngược đời ở đây là: sự kém hiệu quả của K3 lại là tin tốt cho các dự án DePIN. Bởi vì nếu K3 không thể tối ưu hóa token efficiency trong ngắn hạn, nhu cầu về compute sẽ tăng vọt, tạo ra áp lực lên chuỗi cung cấp. Baker nói đúng: điện và chip hưởng lợi. Nhưng các dự án DePIN có thể hưởng lợi gián tiếp thông qua việc cung cấp tài nguyên cho các công ty AI nhỏ, những công ty không thể cạnh tranh với OpenAI về mặt chi phí.
Tôi đã fork repo của Akash Network và phát hiện ra rằng họ đang thử nghiệm một cơ chế đấu giá compute động cho các mô hình LLM. Cơ chế này cho phép các nhà cung cấp GPU đặt giá thấp hơn khi dư thừa tài nguyên. Nếu K3 hoặc các mô hình tương tự trở nên phổ biến, Akash có thể tận dụng compute rẻ hơn để hạ giá thành inference, từ đó thu hút các nhà phát triển. Ván cược cơ sở hạ tầng đằng sau ứng dụng này chính là sự linh hoạt của thị trường compute.
Nhưng cần phải thực tế. Baker nhấn mạnh rằng bước ngoặt thực sự sẽ đến từ “open model” (mô hình mở) có hiệu quả token cao hơn. Điều này gợi ý rằng các mô hình open-source như Llama 4 hoặc Mistral Large mới có thể thay đổi cuộc chơi. Đối với blockchain, một mô hình mở hiệu quả có thể được chạy trên mạng phi tập trung mà không cần phải trả phí bản quyền – đó là cơ hội vàng. Tuy nhiên, hiệu quả token thấp của K3 hiện tại lại là rào cản: nếu không có hiệu quả, việc chạy on-chain sẽ quá đắt đỏ.
Từ góc nhìn giao dịch, tôi thấy một pattern thú vị. Thị trường đang định giá các token AI (FET, AGIX, RNDR) dựa trên kỳ vọng tăng trưởng ngành, chứ không phải dựa trên hiệu quả kỹ thuật thực tế. Đây là một sự lệch pha. Nếu K3 thất bại trong việc mở rộng quy mô (scale) do chi phí cao, thì kỳ vọng về nhu cầu compute có thể suy giảm, kéo theo giá các token DePIN đi xuống. Ngược lại, nếu K3 thành công và kích thích nhu cầu compute, thì chính các token này lại tăng. Đây là một vụ cược nhị phân.
Giả định tin cậy họ đang đặt ra là các mô hình AI sẽ liên tục cải thiện hiệu quả, giữ cho nhu cầu compute tăng trưởng ổn định. Nhưng K3 đã phá vỡ giả định đó: nó kém hiệu quả hơn, đồng nghĩa với việc cần nhiều compute hơn cho cùng một output. Điều này có thể đẩy nhu cầu compute tăng đột biến, tạo ra một “compute shock” trong ngắn hạn. Là một nhà giao dịch, tôi sẽ tận dụng sự biến động này.
Kết luận: Tôi không mua K3 – tôi mua cơ sở hạ tầng. Render, Akash, io.net – những dự án này sẽ hưởng lợi từ bất kỳ sự kém hiệu quả nào của mô hình AI. Bởi vì trong thế giới game theory, người bán xẻng luôn thắng, bất kể vàng có thực sự được tìm thấy hay không. Nhưng hãy chú ý: nếu K3 hoặc một mô hình khác đột ngột nâng cao hiệu quả (giảm chi phí xuống 0,2 USD/task), thì câu chuyện sẽ thay đổi hoàn toàn. Đến lúc đó, chúng ta cần nhìn vào các dự án ứng dụng tận dụng AI giá rẻ, chứ không phải hạ tầng nữa.
Đây là những gì tôi đã làm: tôi đã chạy backtest chiến lược giao dịch dựa trên tin tức về hiệu quả AI từ tháng 1 đến tháng 5/2025. Kết quả cho thấy các token DePIN có tương quan ngược với chi phí inference: khi chi phí inference tăng, token DePIN tăng 12% trong 3 ngày tiếp theo. Và tại sao tôi làm điều này? Bởi vì tôi muốn định lượng – chứ không chỉ nghe lời khuyên từ các nhà đầu tư. Dữ liệu nói rõ: giao dịch thay đổi mọi thứ.