Hook
Các mô hình AI có thể viết thơ, vẽ tranh, thậm chí vượt qua kỳ thi luật sư, nhưng lại không thể đếm chính xác số hình tròn trong một bức ảnh đơn giản. Đó là nghịch lý vừa được Kimi (月之暗面) phơi bày qua việc mở mã nguồn bộ benchmark PerceptionBench. Với kết quả cho thấy mọi mô hình hàng đầu đều đạt dưới 60% độ chính xác, thị trường crypto đang phải đối mặt với một câu hỏi lớn: Liệu những token AI mà chúng ta đang đầu tư có thực sự đáng giá khi ngay cả khả năng nhận thức cơ bản còn chưa hoàn thiện?
Context
PerceptionBench là một bộ benchmark mã nguồn mở được Kimi công bố, tập trung vào khả năng nhận thức thị giác của các mô hình ngôn ngữ lớn đa phương thức (MLLMs). Không giống như các benchmark truyền thống chỉ đo lường khả năng nhận dạng vật thể hoặc mô tả hình ảnh, PerceptionBench phân rã nhận thức thành 10 năng lực nguyên tử, bao gồm: phát hiện ảo giác, đếm chính xác, nhận dạng hướng, phân biệt màu sắc tinh tế, và nhiều hơn nữa. Bộ dữ liệu gồm 3.000 câu hỏi được thiết kế thủ công để kiểm tra ranh giới của từng năng lực. Kết quả thử nghiệm trên 15 mô hình, bao gồm GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro, và chính Kimi K3, cho thấy độ chính xác tối đa chỉ đạt 59,5% – một con số đáng thất vọng so với kỳ vọng. Điều này đặt ra câu hỏi về độ tin cậy của các mô hình khi ứng dụng vào các tác vụ đòi hỏi độ chính xác cao như phân tích hình ảnh on-chain, xác thực NFT, hay vận hành AI agents trong môi trường phi tập trung.
Core
Dựa trên dữ liệu từ PerceptionBench, tôi nhận thấy một điểm thú vị: tất cả các mô hình đều mắc lỗi ảo giác thị giác ở mức độ tương tự nhau. Kimi K3 đạt 58,5%, xếp thứ hai, chỉ sau GPT-5.6-Sol (59,5%). Nhưng điều gây sốc là các tên mô hình như GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro hoàn toàn không khớp với bất kỳ phiên bản công khai nào hiện tại. Đây có thể là mã nội bộ, tên mã dự án, hoặc đơn giản là lỗi in ấn từ phía truyền thông. Trong thế giới crypto, nơi thông tin sai lệch có thể kích hoạt những biến động giá lớn, sự mơ hồ này là một tín hiệu cảnh báo. Từ góc nhìn của một nhà phân tích vĩ mô, tôi liên kết ngay đến chu kỳ thanh khoản toàn cầu. Khi Fed thắt chặt chính sách, các quỹ đầu tư mạo hiểm thường rút vốn khỏi các lĩnh vực rủi ro cao như AI. Một benchmark cho thấy AI vẫn còn yếu kém có thể trở thành cái cớ để dòng tiền chảy ra khỏi các token AI, tạo ra hiệu ứng domino trên toàn thị trường.
Hãy nhìn vào các dự án AI trên blockchain gần đây. Hầu hết đều hứa hẹn về khả năng tự động hóa thông minh, phân tích dữ liệu on-chain theo thời gian thực, hoặc xác thực nội dung hình ảnh. Nhưng nếu mô hình nền tảng vẫn không thể phân biệt được một con chó và một con mèo trong ảnh với độ chính xác cao, thì những lời hứa đó chỉ là giấy. Tôi từng chứng kiến sự sụp đổ của nhiều dự án DeFi vào năm 2020 khi những lỗ hổng kỹ thuật bị phơi bày. Lúc đó, tôi đã xây dựng một framework theo dõi thanh khoản on-chain để phát hiện sớm các dấu hiệu rút lui. Với PerceptionBench, tôi thấy một kịch bản tương tự: các nhà đầu tư có thể bắt đầu nghi ngờ giá trị cốt lõi của các token AI, dẫn đến áp lực bán. Đặc biệt, nếu các mô hình thực sự đạt dưới 60% trong benchmark này, thì mọi sản phẩm dựa trên chúng đều tiềm ẩn rủi ro cao.
Contrarian
Nhưng hãy dừng lại một chút. Đây có thể là một chiến dịch PR có chủ đích. Kimi tự đặt mình vào vị trí “người hùng” khi mở mã nguồn một benchmark mà chính họ đứng thứ hai. Điều này tạo ra cảm giác minh bạch và khiêm tốn, nhưng thực chất là một cách để xây dựng thương hiệu “giải quyết ảo giác”. Từ góc nhìn trái chiều, tôi cho rằng thị trường đang phản ứng thái quá. PerceptionBench chỉ kiểm tra các tác vụ nhận thức cô lập, không phải khả năng suy luận tổng thể. Một mô hình có thể đạt 90% trong benchmark phức tạp hơn nếu kết hợp nhận thức với ngữ cảnh. Hơn nữa, các tên mô hình bất thường cho thấy có thể đây là các phiên bản tùy chỉnh hoặc mô hình thử nghiệm, không đại diện cho sản phẩm thương mại. Các nhà đầu tư nên coi đây là tín hiệu để thẩm định kỹ hơn, chứ không phải lý do để bán tháo.
Takeaway
Thị trường crypto luôn vận hành dựa trên niềm tin. Một benchmark như PerceptionBench có thể làm lung lay niềm tin vào AI, nhưng cũng mở ra cơ hội cho những dự án thực sự giải quyết được bài toán nhận thức. Câu hỏi đặt ra: Liệu các nhà phát triển có tận dụng được dữ liệu này để cải thiện mô hình của họ, hay họ sẽ tiếp tục bán những giấc mơ công nghệ chưa sẵn sàng? Với tư cách là một nhà quan sát vĩ mô, tôi sẽ theo dõi dòng tiền di chuyển giữa các token AI trong những tuần tới. Nếu thấy sự sụt giảm đột ngột, đó sẽ là tín hiệu xác nhận rằng thị trường đã tin vào câu chuyện của PerceptionBench. Còn nếu giá vẫn ổn định, thì đây chỉ là một cơn gió thoảng qua.
— Nguyễn Hào, Macro Watcher