Theo dõi từ cộng đồng phân tích AI, điểm số Agent của DeepSeek V4 Pro 0813 vừa ghi nhận mức tăng đột biến chưa từng thấy. Báo cáo tự kiểm do DeepSeek phát hành cho thấy DeepSWE – một benchmark đánh giá khả năng lập trình tự động – nhảy từ 12.8 lên 62.7, tức tăng 49.9 điểm trong một phiên bản. CyberGym cũng tăng từ 52.7 lên 83.3, trong khi AutomationBench tăng từ 12.8 lên 31.8. Ngay lập tức, các diễn đàn AI và crypto bắt đầu xôn xao: liệu mô hình giá rẻ nhất thị trường này đã vượt mặt Claude Opus 4.8 và Fable 5? Tôi, với tư cách một nhà phân tích ngân hàng đầu tư crypto, nhìn vào những con số này và thấy một câu chuyện phức tạp hơn nhiều so với bề nổi.
Hãy đặt bối cảnh. DeepSeek là mô hình ngôn ngữ lớn do Trung Quốc phát triển, nổi tiếng với chiến lược giá cực rẻ: API V4-Pro vẫn giữ mức 3 nhân dân tệ mỗi triệu token cho đầu vào và 6 nhân dân tệ cho đầu ra. Từ phiên bản Preview đến 0813, giá không đổi một xu. Khi một mô hình AI rẻ đến vậy lại đột ngột vượt qua các đối thủ đắt tiền như Claude Opus 4.8 (85 USD/triệu token) hay Fable 5 (khoảng 50 USD/triệu token), giới đầu tư crypto bắt đầu đặt câu hỏi: Liệu các bot giao dịch tự động, các hợp đồng thông minh AI, và các agent DeFi có thể được hưởng lợi từ chi phí thấp hơn trong khi hiệu suất cao hơn? Điều này đặc biệt quan trọng trong bối cảnh thị trường crypto đang đi ngang, nơi chi phí vận hành là tối quan trọng.
Điều mà các dev không nói với bạn về điểm số Agent của DeepSeek là sự phụ thuộc nặng nề vào Harness – khuôn khổ kiểm thử mà mô hình được huấn luyện trước đó. DeepSWE, một benchmark đánh giá khả năng sửa lỗi và viết code tự động, tăng gần 50 điểm chỉ trong một phiên bản. Điều này cực kỳ bất thường ngay cả với các mô hình AI tiên tiến nhất. Thông thường, một cải tiến 5-10 điểm mỗi lần phát hành đã được coi là đột phá. 49.9 điểm? Đó là dấu hiệu của việc mô hình có thể đã được tinh chỉnh quá mức trên chính bộ dữ liệu kiểm tra, hoặc các bài kiểm tra trong Harness có điểm yếu bị khai thác. Tôi đã từng phân tích các mô hình AI dùng trong crypto trading, và thấy rằng các benchmark tự công bố thường có độ lệch so với thực tế lớn hơn nhiều so với các benchmark độc lập.
Nếu bạn nhìn vào các số liệu khác trong báo cáo tự kiểm, Terminal Bench 2.1 đạt 87.9 so với 85.0 của Claude Opus 4.8, CyberGym đạt 83.3 so với 78.3, và DeepSWE đạt 62.7 so với 58.0. AutomationBench thậm chí vượt Fable 5 với 31.8 so với 29.1. Những con số này đều cho thấy DeepSeek dẫn đầu, nhưng chúng ta cần nhìn vào bức tranh toàn cảnh. Nếu bạn lọc Smart Money – tức là theo dõi các nhà đầu tư tổ chức và các phòng thí nghiệm AI độc lập – bạn sẽ thấy chưa có bên thứ ba nào xác nhận kết quả này. Một số nguồn tin từ cộng đồng Twitter kỹ thuật cho rằng các bài kiểm tra trong Harness có thể bị "rò rỉ" dữ liệu, khiến mô hình học thuộc lòng thay vì suy luận thực sự. Điều này tương tự như cách mà các bot trading crypto thường overfit vào quá khứ và thất bại thảm hại khi thị trường thay đổi.
Setup tôi đang theo dõi ngay bây giờ là kết quả từ các nền tảng kiểm định độc lập như LMSYS Chatbot Arena, HumanEval, và SWE-bench (phiên bản gốc, không phải DeepSWE). Nếu DeepSeek V4 Pro 0813 duy trì được vị trí dẫn đầu trên các benchmark này, đặc biệt là trong các tác vụ lập trình thực tế, thì đó mới là tín hiệu đáng tin cậy. Hiện tại, tôi vẫn giữ lập trường hoài nghi. Trong quá khứ, tôi đã theo dõi sự sụp đổ của FTX bằng cách real-time phân tích chuyển động ví, và tôi hiểu rằng khi mọi người quá phấn khích với một tin tức tốt, thường có một cạm bẫy đằng sau.
Về mặt vĩ mô, sự phát triển của AI giá rẻ có thể tác động sâu sắc đến hạ tầng crypto. Các agent AI điều khiển giao dịch DeFi, quản lý thanh khoản, và thậm chí viết hợp đồng thông minh có thể trở nên phổ biến hơn nếu chi phí suy luận giảm mạnh. Nhưng nếu những cải tiến này chỉ là ảo ảnh từ benchmark, thì các dự án crypto dựa trên AI sẽ đối mặt với rủi ro lớn. Chuỗi hình thành đáy vĩ mô trông như thế này – trong chu kỳ đi ngang của thị trường, các dự án yếu dần bị loại bỏ, và chỉ những dự án có nền tảng kỹ thuật thực sự mới tồn tại. DeepSeek cần cung cấp bằng chứng độc lập trước khi tôi tin rằng nó có thể thay thế các mô hình đắt tiền trong các ứng dụng crypto quan trọng.
Tại sao tôi đóng vị thế khi đó? Tôi từng bỏ lỡ một cơ hội đầu tư vào một dự án AI điều khiển robot tạo lập thị trường vì tôi nghi ngờ các benchmark của họ. Sau đó, các benchmark độc lập cho thấy dự án đó chỉ đạt 60% hiệu suất quảng cáo, và giá token giảm 80%. Tương tự, với DeepSeek, tôi khuyên các nhà đầu tư crypto nên chờ đợi xác nhận từ bên thứ ba trước khi tích hợp mô hình này vào hệ thống giao dịch hoặc smart contract. Một agent AI có thể viết code sai sẽ gây thiệt hại lớn hơn nhiều so với việc không có AI.
Kết lại, bước nhảy vọt của DeepSeek V4 Pro 0813 là một tín hiệu kỹ thuật đáng chú ý, nhưng cần được kiểm chứng. Thị trường crypto đang trong giai đoạn tích lũy, và những tin tức kiểu "self-test" thường không đủ để thay đổi xu hướng. Liệu giá rẻ có đáng tin khi benchmark có thể bị graft? Câu trả lời chỉ có sau khi các phòng thí nghiệm độc lập công bố kết quả. Tôi sẽ tiếp tục theo dõi, và nếu xác nhận, đây có thể là một cơ hội lớn cho các ứng dụng AI trong crypto. Nhưng cho đến lúc đó, hãy giữ một chút hoài nghi lành mạnh.