BTC $77,641.9 -2.54%
ETH $2,434.75 -2.99%
SOL $103.51 -2.72%
BNB $689.2 -2.53%
XRP $1.39 -2.85%
DOGE $0.0844 -3.11%
ADA $0.2001 -4.53%
AVAX $7.26 -2.46%
DOT $0.8400 -4.28%
LINK $11.33 -3.90%
⛽ ETH Gas 28 Gwei
Sợ&Tham
68

DeepSeek V4 Pro vs Claude: Cuộc chiến benchmark và bài học từ những con số ảo

Altcoin | Ngô Vĩnh |

Ngày 15/5, một bài viết xuất hiện trên một trang tin blockchain. Nó tuyên bố DeepSeek V4 Pro chỉ kém Claude 5% về hiệu năng, nhưng rẻ hơn 45 lần. Tôi đọc tiêu đề, rồi đọc lại. Cảm giác quen thuộc. Giống như năm 2017, khi một ICO hứa hẹn “công nghệ đột phá” nhưng không có whitepaper. Tôi bắt đầu lần theo chuỗi ICO mất dấu từ năm 2017.

Context: Tại sao là bây giờ?

Thị trường AI đang nóng. Mỗi tuần đều có một benchmark mới, một model mới, một tuyên bố “đánh bại GPT”. Nhưng với tôi, người đã dành 20 năm quan sát ngành crypto, câu chuyện này có một điểm chung: sự thiếu minh bạch. Bài viết gốc không đưa ra tên benchmark, không có số điểm gốc, và quan trọng nhất, nó nhắc đến “Claude Fable” – một cái tên không tồn tại trong hệ thống model của Anthropic. Họ có Opus, Sonnet, Haiku. Không có Fable. Đây có thể là lỗi dịch thuật, hoặc tệ hơn, là một chiến dịch marketing có chủ đích.

Tôi nhớ lại DeFi Summer 2020. Khi đó, tôi xây dựng dashboard tổng hợp thanh khoản từ Uniswap, Compound, Aave. Tôi học được rằng: dữ liệu không được kiểm chứng là dữ liệu chết. 12 nguồn on-chain, 3 tháng tối ưu, nhưng tôi vẫn giữ bước kiểm thủ công cuối cùng. Vì một con số sai có thể khiến độc giả mất tiền. Ở đây cũng vậy. Một tuyên bố “chỉ kém 5%” có thể khiến hàng ngàn nhà phát triển chuyển sang DeepSeek mà không biết rằng điểm số đó có thể được thổi phồng.

Core: Phân tích kỹ thuật – Những mảnh ghép tạo nên bức tranh crypto

Hãy nhìn vào các con số. Bài viết nói “kém 18 điểm” và “chỉ kém 5%”. Nếu 18 điểm bằng 5%, thì tổng điểm benchmark phải khoảng 360. Nhưng không có benchmark nào phổ biến có thang điểm 360. MMLU có thang 100, HellaSwag có thang 100, GSM8K có thang 100. Sự khập khiễng này cho thấy hai con số đến từ hai nguồn khác nhau, được ghép lại để tạo hiệu ứng giật tít.

Tôi từng chứng kiến điều tương tự trong NFT năm 2021. Một dự án tuyên bố “tăng trưởng 500%” nhưng thực tế chỉ là từ 1 NFT lên 5 NFT. Con số đúng, nhưng ngữ cảnh sai. Ở đây, “45 lần rẻ hơn” có thể đúng nếu so sánh giá output token của DeepSeek V3 với Claude Opus, nhưng không tính đến chi phí vận hành, độ trễ, hay tính năng enterprise. Và nếu model DeepSeek V4 Pro thực sự là một phiên bản cải tiến từ V3, thì giá có thể đã thay đổi. Không có thông tin về giá API cụ thể.

Thêm vào đó, “Claude Fable” không tồn tại. Điều này đặt ra câu hỏi: liệu toàn bộ bài viết có được tạo ra bởi AI không? Một AI có thể “hallucinate” ra tên model. Nếu vậy, không có nguồn tin nào đáng tin cậy. Tôi đã phát triển công cụ AI phát hiện rug pull NFT năm 2021. Tôi biết rằng AI có thể tạo ra nội dung rất thuyết phục, nhưng thiếu tính xác thực. Bài viết này có thể là một ví dụ.

Contrarian: Góc nhìn phản trực giác – Nếu nó đúng thì sao?

Nhưng hãy giả sử tuyên bố là đúng. DeepSeek V4 Pro thực sự chỉ kém Claude 5% và rẻ hơn 45 lần. Điều đó có nghĩa gì? Nó sẽ thay đổi cuộc chơi AI compute. Các dự án crypto như Render, Bittensor, Akash sẽ hưởng lợi lớn vì nhu cầu tính toán rẻ tăng vọt. Nhưng cũng có thể gây ra một cuộc chiến giá, nơi các nhà cung cấp API buộc phải giảm giá, làm giảm lợi nhuận của toàn bộ ngành.

Tôi nhìn thấy sự tương đồng với cuộc chiến phí trên Layer2. Optimism và Arbitrum từng tuyên bố “phí rẻ hơn 100 lần so với Ethereum mainnet”. Nhưng thực tế, sequencer của họ vẫn tập trung, và “decentralized sequencing” vẫn chỉ là PowerPoint. Tương tự, DeepSeek có thể rẻ hơn, nhưng liệu nó có đáng tin cậy cho các ứng dụng tài chính? Một model AI tạo ra lỗi trong smart contract audit có thể gây thiệt hại hàng triệu USD. Giá rẻ không phải lúc nào cũng tốt.

Takeaway: Theo dõi tiếp theo

Tôi không thể khẳng định bài viết này là sai hay đúng. Nhưng tôi có thể nói rằng: trong thời đại AI-generated content, việc kiểm chứng nguồn tin quan trọng hơn bao giờ hết. Hãy tự hỏi: liệu bạn có dùng một model AI không rõ nguồn gốc để kiểm tra smart contract của mình không? Tôi thì không. Và tôi nhắc bạn: hãy luôn kiểm tra 3 nguồn trước khi tin vào bất kỳ benchmark nào. Bởi vì trong crypto, cũng như trong AI, sự thật thường nằm ở những con số bị bỏ qua.