BTC $77,419.8 +0.30%
ETH $2,446.21 +1.10%
SOL $94.81 +0.16%
BNB $700 +0.70%
XRP $1.49 +0.10%
DOGE $0.0920 +0.09%
ADA $0.2211 -1.03%
AVAX $7.52 +0.60%
DOT $0.9088 -0.45%
LINK $11.47 -0.82%
⛽ ETH Gas 28 Gwei
Sợ&Tham
73

DeepSeek-V4-Pro-0813: Cú nhảy 50 điểm DeepSWE – Tín hiệu đỏ hay đột phá thực sự?

Thị trường dự đoán | Nguyễn Tâm |
Mỗi benchmark là một lỗ hổng tiềm ẩn với lớp sơn bóng. Hôm qua, dữ liệu tự kiểm tra của DeepSeek-V4-Pro-0813 rò rỉ qua các kênh giám sát. Con số khiến tôi phải dừng lại: DeepSWE từ 12.8 lên 62.7 – một bước nhảy gần 50 điểm. CyberGym từ 52.7 lên 83.3. AutomationBench từ 12.8 lên 31.8. Và tất cả điều này xảy ra mà không có một xu tăng giá nào. API V4-Pro vẫn giữ mức 3 NDT/triệu token đầu vào, 6 NDT cho đầu ra. Nghe có vẻ như một câu chuyện cổ tích thời AI. Nhưng tôi đã ở trong ngành này đủ lâu để biết: khi một con số tăng vọt mà không có thay đổi kiến trúc rõ ràng, tôi bắt đầu đặt câu hỏi về harness. Bối cảnh: DeepSeek đang cạnh tranh trực tiếp với Claude Opus 4.8 và Fable 5. Phiên bản Preview trước đó chỉ đạt 12.8 trên DeepSWE – một chỉ số đánh giá khả năng tự động hóa tác vụ lập trình. Trong khi đó, Claude Opus 4.8 đạt 58.0, Fable 5 đạt 29.1. Vậy làm thế nào một mô hình chỉ trong vài tháng lại vượt qua cả hai đối thủ nặng ký, đặc biệt là trong lĩnh vực Agent? Câu trả lời nằm ở chi tiết kỹ thuật. DeepSWE là một bài kiểm tra Agent, và Agent evaluation phụ thuộc rất nhiều vào Harness – lớp kiểm soát môi trường thực thi. Một harness được tinh chỉnh có thể dễ dàng thổi phồng điểm số mà không cần cải thiện năng lực thực sự của mô hình. Tôi đã từng chứng kiến điều tương tự trong các hợp đồng thông minh: một bài kiểm tra bảo mật có thể bị qua mặt nếu người viết test biết trước các trường hợp biên. Hãy nhìn vào các chỉ số khác. Terminal Bench 2.1 đạt 87.9 so với 85.0 của Claude Opus 4.8 – một mức tăng khiêm tốn, có thể giải thích bằng tối ưu hóa. CyberGym 83.3 so với 78.3 – cũng hợp lý. Nhưng DeepSWE từ 12.8 lên 62.7? Đó không phải là tối ưu hóa, đó là một sự thay đổi bản chất. Hoặc là họ đã phát hiện ra một phương pháp huấn luyện đột phá, hoặc harness đã được điều chỉnh để phù hợp với bài kiểm tra. Tôi đã từng phân tích một dự án DeFi năm 2021, nơi đội ngũ tuyên bố tăng 300% hiệu suất giao dịch chỉ sau một bản cập nhật. Khi tôi mổ xẻ code, hóa ra họ chỉ thay đổi tham số trượt giá trong môi trường test. Kết quả thực tế trên mainnet thậm chí còn tồi tệ hơn. DeepSeek có thể đang ở trong tình huống tương tự. Phần contrarian: điều gì nếu đây là thật? Nếu DeepSeek thực sự đã tìm ra cách để nhảy vọt trong năng lực Agent mà không tăng chi phí? Điều đó sẽ thay đổi cuộc chơi. Các mô hình AI rẻ hơn, mạnh hơn có thể được tích hợp vào blockchain để tự động hóa kiểm toán, tối ưu hóa thanh khoản, thậm chí vận hành DAO. Nhưng ngay cả khi điều đó xảy ra, tôi vẫn đặt câu hỏi về tính bền vững: một mô hình rẻ tiền nhưng mạnh mẽ sẽ tạo ra rủi ro tập trung hóa mới – ai kiểm soát harness đó? Ai đảm bảo rằng điểm số không bị thao túng? Takeaway: DeepSeek-V4-Pro-0813 là một tín hiệu đáng chú ý, nhưng chưa phải là bằng chứng. Cộng đồng cần các bài kiểm tra độc lập từ các tổ chức như MLPerf hay Stanford CRFM. Nếu không, chúng ta chỉ đang nhìn vào một bức tranh được vẽ bởi chính người bán hàng. Và trong thế giới blockchain, tôi đã học được rằng: niềm tin vào self-report là lỗ hổng lớn nhất.