DeepSeek V4 vừa ra mắt, liệu dự đoán của Jensen Huang có trở thành sự thật?

VNZ-TECHS
“Một khi DeepSeek đi đầu phát hành trên nền tảng Huawei, đó sẽ là kết cục mang tính thảm họa đối với Mỹ.”
Đây lời phát biểu nguyên văn của Jensen Huang trong một podcast. Và giờ đây, với sự xuất hiện của DeepSeek V4, liệu lời dự đoán đó có trở thành hiện thực?
Là bản nâng cấp lớn mà mọi người chờ đợi hơn một năm, nếu chỉ nhìn vào hiệu năng thì có thể sẽ hơi thất vọng. Nhưng DeepSeek V4 lại cực kỳ rẻ, mức giá so với các mô hình khác gần như giảm một nửa.


Về chi tiết kỹ thuật của DeepSeek V4 : Bước vào kỷ nguyên phổ cập ngữ cảnh 1 triệu token.

DeepSeek-V4 sở hữu khả năng xử lý ngữ cảnh siêu dài lên tới 1 triệu token, đồng thời đạt vị trí dẫn đầu trong lĩnh vực nội địa và mã nguồn mở về năng lực Agent, kiến thức thế giới và khả năng suy luận. Mô hình được chia thành hai phiên bản theo quy mô:

Ngay từ bây giờ, người dùng có thể đăng nhập trang web chat.deepseek.com hoặc ứng dụng chính thức để trải nghiệm DeepSeek-V4, khám phá khả năng ghi nhớ ngữ cảnh siêu dài 1M hoàn toàn mới. Dịch vụ API cũng đã được cập nhật, chỉ cần thay đổi model_name thành deepseek-v4-pro hoặc deepseek-v4-flash là có thể gọi.

Link mã nguồn mở DeepSeek-V4:
Báo cáo kỹ thuật:

Dưới đây là giới thiệu chính thức của hai phiên bản:

DeepSeek-V4-Pro







  • Năng lực Agent tăng mạnh: So với thế hệ trước, khả năng Agent của V4-Pro được cải thiện rõ rệt. Trong bài đánh giá Agentic Coding, V4-Pro đạt mức tốt nhất trong các mô hình mã nguồn mở hiện tại, đồng thời cũng có kết quả rất tốt ở các benchmark liên quan đến Agent khác. Hiện tại, DeepSeek đã sử dụng V4 nội bộ cho lập trình Agentic Coding, với phản hồi cho thấy trải nghiệm vượt Claude Sonnet 4.5, và chất lượng đầu ra tiệm cận Claude Opus 4.6 (chế độ không suy luận), dù vẫn còn khoảng cách với chế độ suy luận của Opus 4.6.
  • Kiến thức thế giới phong phú: Trong các bài test kiến thức tổng hợp, V4-Pro vượt xa các mô hình mã nguồn mở khác, chỉ xếp sau các mô hình đóng hàng đầu như Gemini-Pro-3.1.
  • Khả năng suy luận hàng đầu thế giới: Trong các bài test về toán học, STEM và lập trình dạng thi đấu, V4-Pro vượt qua toàn bộ mô hình mã nguồn mở đã công bố, đạt hiệu năng ngang tầm các mô hình đóng hàng đầu thế giới.



DeepSeek-V4-Flash

  • So với V4-Pro, V4-Flash kém hơn đôi chút về kiến thức thế giới, nhưng vẫn có khả năng suy luận gần tương đương. Nhờ số lượng tham số và kích hoạt nhỏ hơn, V4-Flash cung cấp API nhanh hơn và tiết kiệm chi phí hơn.
  • Trong các bài test Agent, V4-Flash có thể ngang ngửa V4-Pro ở các tác vụ đơn giản, nhưng vẫn có khoảng cách ở các nhiệm vụ phức tạp.

DeepSeek-V4 giới thiệu một cơ chế attention hoàn toàn mới, thực hiện nén theo chiều token, kết hợp với DSA (DeepSeek Sparse Attention), giúp đạt khả năng xử lý ngữ cảnh dài hàng đầu thế giới, đồng thời giảm đáng kể yêu cầu về tính toán và bộ nhớ so với các phương pháp truyền thống. Từ nay, ngữ cảnh 1 triệu token sẽ trở thành tiêu chuẩn mặc định trong tất cả dịch vụ chính thức của DeepSeek.

Ngoài ra, DeepSeek-V4 đã được tối ưu và thích nghi với nhiều sản phẩm Agent phổ biến như Claude Code, OpenClaw, OpenCode, CodeBuddy…, giúp cải thiện hiệu năng trong các tác vụ lập trình và tạo tài liệu.

Cả V4-Pro và V4-Flash đều hỗ trợ ngữ cảnh tối đa 1M, đồng thời có hai chế độ: không suy luậnsuy luận. Trong đó, chế độ suy luận cho phép điều chỉnh mức độ “suy nghĩ” thông qua tham số reasoning_effort (high / max). Với các kịch bản Agent phức tạp, nên sử dụng chế độ suy luận và đặt mức max.

Cuối cùng, hai tên model API cũ là deepseek-chatdeepseek-reasoner sẽ bị ngừng hỗ trợ sau 3 tháng (24/07/2026). Trong giai đoạn chuyển tiếp, hai tên này lần lượt trỏ tới chế độ không suy luận và suy luận của deepseek-v4-flash.

Điều quan trọng hơn lần ra mắt này là việc DeepSeek chọn phát hành đầu tiên trên nền tảng Huawei Ascend, đồng nghĩa với việc họ đã hoàn tất việc thích nghi huấn luyện trên phần cứng nội địa Trung Quốc.

Lần này phần đầu tiên hỗ trợ huấn luyện bằng phần cứng nội địa Trung Quốc là giai đoạn hậu huấn luyện của DeepSeek V4 Flash. Còn việc tiền huấn luyện trên nền tảng nội địa cũng có thể sẽ được triển khai trong nửa cuối năm nay.

Nói cách khác, từ thời điểm này, điều mà mọi người nói suốt lâu nay: toàn bộ chuỗi AI sử dụng phần cứng nội địa Trung Quốc đã chính thức trở thành hiện thực.

Bạn có thể hiểu nền tảng Ascend của Huawei là một hệ sinh thái tính toán AI mà ngay cả chip cũng do Trung Quốc tự phát triển.

Nếu một năm trước có ai nói rằng một nền tảng AI “thuần nội địa” có thể hỗ trợ toàn bộ quy trình phát triển một mô hình flagship, giờ điều đó đã xảy ra — và tác động của nó đối với AI nội địa Trung Quốc là rất sâu rộng.

Trước đây, Jensen Huang từng nhiều lần dùng lập luận này để vận động chính phủ Mỹ. Theo ông, trong cuộc chạy đua AI, từ cơ sở hạ tầng như điện, làm mát, phòng cháy, đến chip, máy chủ, rồi hệ sinh thái phần mềm và kiến trúc mô hình, tất cả đều quan trọng, thiếu một mắt xích là không thể thắng.

AI giống như một “chiếc bánh 5 tầng”.

Thế mạnh của Trung Quốc rõ ràng là năng lực xây dựng hạ tầng và nguồn nhân lực dồi dào, giúp tạo ra các mô hình có hiệu năng/giá thành rất tốt.

Tuy nhiên, cũng phải thừa nhận rằng công nghệ chế tạo chip vẫn còn khoảng cách so với đỉnh cao thế giới. Nhưng AI là cuộc chiến về quy mô và cụm hệ thống, nên các kỹ sư đã tìm cách bù đắp:
  • Một là: dù công nghệ sản xuất chip còn hạn chế, có thể “đắp số lượng” để tăng sức mạnh tính toán. Đồng thời phát triển HBM (bộ nhớ băng thông cao) nội địa để tránh nghẽn băng thông.
  • Hai là: hiệu năng mỗi chip có thể không quá mạnh, nhưng số lượng lớn thì có thể kết hợp thành “trung tâm tính toán” — chính là xu hướng siêu node (supernode) đang rất hot.
Khái niệm siêu node vốn do NVIDIA đề xuất. Hệ thống NVL72 của họ tích hợp 72 GPU Blackwell trong một tủ làm mát bằng chất lỏng, đạt khoảng 180 PFLOPs FP16.


Trong khi đó, để đạt mức tương đương, chip nội địa cần dùng nhiều phần cứng hơn. Ví dụ, Huawei đã triển khai hệ thống 384 siêu node với 12 tủ rack, mỗi tủ 32 card, đạt 300 PFLOPs, gần gấp đôi NVL72. Và tại MWC năm nay, Huawei còn trình diễn Atlas 950 với 8192 card kết nối.


Nhưng mắt xích quan trọng nhất vẫn là hệ sinh thái.

Phải thừa nhận rằng Jensen Huang thực sự có tầm nhìn. 20 năm trước, NVIDIA đã đặt nền móng cho hệ sinh thái CUDA, thậm chí từng hy sinh lợi nhuận mảng GPU gaming để theo đuổi nó.

Và họ đã trụ vững. Kết quả là hiện nay gần như toàn bộ mô hình AI đều chạy trên CUDA, khiến các hệ sinh thái GPU/TPU khác cũng phải tương thích theo.

Ngay cả một “hào nước” của DeepSeek trước đây tối ưu ngôn ngữ PTX cũng nhằm khai thác tối đa hiệu năng GPU NVIDIA để tăng hiệu suất và giảm chi phí.

Vì vậy, trong bối cảnh bị hạn chế công nghệ, các nền tảng như CANN của Huawei hay MUSA của Moore Threads vẫn phải hỗ trợ CUDA để thu hút lập trình viên.

Tuy nhiên, không thể mãi phụ thuộc vào hệ sinh thái của người khác. Việc xây dựng hệ sinh thái phần mềm riêng là điều cấp thiết. Những dự án như TileLang đang bắt đầu hình thành theo hướng này.

Dù vậy, các nỗ lực này trước đây vẫn chưa đủ để tạo ảnh hưởng lớn tới CUDA.

Cho đến DeepSeek V4.

Lần này, DeepSeek tiến thêm một bước: từ chối tối ưu trước cho NVIDIA và AMD, mà chọn thẳng nền tảng Huawei Ascend và hệ sinh thái CANN nội địa.


Thông điệp rất rõ ràng:
Không cần chip và công nghệ Mỹ, vẫn có thể tạo ra mô hình AI tiên tiến.


Đây vừa là bước đi đáng nể, vừa mang tính “định chuẩn” gửi tín hiệu tới các công ty AI nội địa khác rằng: chuỗi công nghệ nội địa đã hoàn chỉnh, mọi người có thể thử.

Ngoài ra, còn một yếu tố khác: AI đang trở nên ngày càng mạnh.

Gần đây, các mô hình lớn không chỉ dừng ở hội thoại. Ví dụ, Anthropic đã phát triển mô hình Mythos, được cho là mạnh đến mức chưa dám công bố rộng rãi, mà chỉ đưa cho các tập đoàn lớn như Apple, NVIDIA, Microsoft để kiểm tra lỗ hổng bảo mật.

Điều này cho thấy AI không còn chỉ là công cụ, mà đã trở thành “vũ khí” trong không gian mạng, vừa là lá chắn, vừa là mũi tấn công giữa các quốc gia.


Vì vậy, từ phần cứng đến phần mềm, từ mô hình đến hệ sinh thái, nội địa hóa toàn bộ chuỗi AI là điều bắt buộc nếu muốn tránh bị phụ thuộc.


Khi GPU của NVIDIA không còn là lựa chọn duy nhất, khi “hào nước” CUDA không còn tuyệt đối, khi nhân lực AI ngày càng dồi dào — thì nền tảng công nghiệp cũng sẽ tự tin hơn.


Nhìn lại câu kết trong thông báo của DeepSeek V4:
“Không bị mê hoặc bởi lời khen, không sợ hãi trước lời chê, kiên định con đường của mình” đây không chỉ là tuyên ngôn của các công ty AI Trung Quốc, mà còn là sự khẳng định cho cả hệ sinh thái AI nội địa đã đi từng bước đến hôm nay.

Có lẽ, lời dự đoán của Jensen Huang… đã phần nào trở thành sự thật.