Blog / AI / Deep Article
Vậy khi giá token tiến gần về 0 cho các tác vụ phổ thông, giá trị của một startup AI nằm ở đâu?
Ngày 10/9/2026, DeepSeek công bố DeepSeek-V4.1-Flash với ba điểm được nêu đích danh: ngữ cảnh 1 triệu token, FP4 KV cache, và Cross-Layer Attention Reuse (https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/). Cùng ngày, cộng đồng kỹ thuật Trung Quốc mở một câu hỏi trên Zhihu với tiêu đề đúng bốn chữ: "如何评价正式发布的 DeepSeek V4.1 Flash?" (https://www.zhihu.com/question/2081380378493961583). Song song đó, dòng tin trên Baidu gọn hơn: "DeepSeek正式发布新模型 定价下调" — phát hành model mới, giá下调 (https://www.baidu.com/s?wd=DeepSeek%E6%AD%A3%E5%BC%8F%E5%8F%91%E5%B8%83%E6%96%B0%E6%A8%A1%E5%9E%8B+%E5%AE%9A%E4%BB%B7%E4%B8%8B%E8%B0%83).
Ba dòng tin, ba trọng tâm khác nhau. MarkTechPost nhấn vào kiến trúc. Zhihu nhấn vào phản ứng cộng đồng. Baidu nhấn vào giá. Điều đáng nói là cả ba đều đúng, nhưng thứ tự quan trọng lại ngược với cách DeepSeek đóng gói thông điệp. Giá là thứ khiến người ta bấm vào. Kiến trúc là thứ khiến người ta ở lại. Còn 1M context là thứ khiến người ta phải viết lại kiến trúc sản phẩm.
Con số 1 triệu token nghe rất thoả mãn. Nó tương đương khoảng vài trăm trang tài liệu, hoặc một codebase cỡ trung, hoặc toàn bộ lịch sử trao đổi của một khách hàng doanh nghiệp trong nhiều tháng. Với các đội làm sản phẩm RAG ở Việt Nam — nơi một bạn dev ở FPT Software hay một startup nhỏ ở Hà Nội thường phải tự dựng pipeline chunking, embedding, reranking — con số đó hấp dẫn theo kiểu "nếu nhét hết vào context thì bỏ được cả tầng vector database".
Nhưng cái bẫy nằm ở chỗ khác. Ngữ cảnh dài không miễn phí. Mỗi token trong context đều phải được attend, và chi phí attention tăng theo bình phương độ dài nếu không có tối ưu. Đó là lý do tại sao hai tính năng còn lại trong thông báo của DeepSeek không phải là phần phụ — chúng là điều kiện để 1M context trở thành thứ dùng được thay vì một dòng marketing. Nếu KV cache phình lên theo độ dài context, thì 1M token chỉ có nghĩa là hoá đơn GPU tăng 1M lần tương ứng.
Một điểm thực tế: cửa sổ context lớn thường đi kèm hiện tượng "lost in the middle" — model nhớ tốt đầu và cuối, mờ dần ở giữa. Vấn đề là DeepSeek không công bố kèm một benchmark dài hạn nào trong thông báo được MarkTechPost ghi lại. Không có số liệu retrieval accuracy ở độ sâu 500K token thì 1M vẫn là một lời hứa, không phải một năng lực đã kiểm chứng.
Liệu một đội 5 người ở TP.HCM có nên vứt bỏ vector database vì con số này?
KV cache là bộ nhớ lưu trữ key và value của toàn bộ token đã qua, để model không phải tính lại từ đầu mỗi khi sinh token mới. Ở context ngắn, nó không đáng lo. Ở context 1M, nó trở thành nút cổ chai lớn nhất — lớn hơn cả trọng số model trong nhiều trường hợp.
FP4 nghĩa là lưu cache ở định dạng dấu phẩy động 4 bit. Cách hiểu kỹ thuật thông thường: thay vì giữ mỗi giá trị trong 16 bit (FP16) hay 8 bit (FP8), DeepSeek nén xuống 4 bit. Về mặt lý thuyết, đó là mức giảm dung lượng bộ nhớ tính theo bậc, và kéo theo khả năng nhồi nhiều request hơn lên cùng một GPU — hoặc phục vụ cùng một request dài hơn với ít card hơn.
Đây là điểm đáng nói nhất trong cả thông báo, và cũng là điểm ít được truyền thông đại chúng nhắc nhất. Lượng tử hoá trọng số (weight quantization) đã thành chuyện thường ngày từ lâu. Lượng tử hoá KV cache khó hơn nhiều, vì cache là dữ liệu động, sinh ra theo thời gian thực, và sai số ở đây tích luỹ trực tiếp vào chất lượng câu trả lời. Nếu DeepSeek làm được FP4 KV cache mà không sụp chất lượng, đó là một tuyên bố kỹ thuật lớn hơn nhiều so với việc giảm giá.
So sánh nhanh: các lab phương Tây như Meta với dòng Llama, hay Mistral, từng công bố nhiều kỹ thuật nén cache khác nhau, nhưng phần lớn dừng ở mức 8 bit hoặc dùng cơ chế chọn lọc token (eviction) thay vì nén toàn bộ. Google với Gemini từng đẩy context lên rất dài, nhưng đi kèm mô hình giá theo bậc độ dài. DeepSeek đi hướng khác: nén cache xuống mức thấp nhất có thể, rồi giữ giá phẳng.
Nhưng câu hỏi chưa được trả lời: FP4 ảnh hưởng thế nào tới các tác vụ cần độ chính xác số học cao, ví dụ sinh code có tính toán hoặc phân tích tài chính? Không có con số nào trong nguồn để trả lời.
Tính năng thứ ba, Cross-Layer Attention Reuse, là phần kỳ lạ nhất và cũng là phần gợi ý nhiều nhất về triết lý thiết kế của DeepSeek. Cách hiểu thông thường từ tên gọi: thay vì mỗi layer trong transformer tự tính và lưu KV riêng, model tái sử dụng KV của layer này cho layer khác.
Ý tưởng này không mới về nguyên lý — Multi-Query Attention và Grouped-Query Attention đã làm điều tương tự ở chiều head, chia sẻ key/value giữa nhiều query head để giảm kích thước cache. Cross-Layer Attention Reuse mở rộng logic đó sang chiều layer. Nếu nhiều layer chia sẻ cùng một bộ KV, dung lượng cache giảm theo tỉ lệ số layer tham gia chia sẻ.
Ghép FP4 với Cross-Layer Attention Reuse, hiệu ứng nhân lên. Nén 4 bit đã giảm mạnh; chia sẻ giữa các layer giảm thêm một tầng nữa. Đây là cách một model có thể tuyên bố 1M context mà vẫn vận hành được ở chi phí hợp lý. Nói cách khác, ba tính năng trong thông báo không phải ba tính năng độc lập — chúng là một hệ thống. 1M context là mục tiêu, FP4 KV cache và Cross-Layer Attention Reuse là hai trong số các phương tiện, còn giảm giá là hệ quả thương mại.
Vấn đề là bất kỳ hình thức chia sẻ nào cũng là một đánh đổi. Chia sẻ KV giữa các layer nghĩa là mỗi layer mất quyền biểu diễn attention theo cách riêng. Với các tác vụ suy luận nhiều bước — loại tác vụ mà các lab như OpenAI vẫn dùng làm điểm nhấn cho các dòng model reasoning — đánh đổi này có thể lộ ra. DeepSeek không công bố ablation study nào về việc mất bao nhiêu điểm chất lượng khi bật cơ chế này.
Câu hỏi thật sự là: DeepSeek đang tối ưu cho loại tác vụ nào, và họ chấp nhận bỏ bao nhiêu phần trăm chất lượng ở loại tác vụ khác?
Dòng tin trên Baidu gọi thẳng tên sự việc: phát hành model mới, giá下调 (https://www.baidu.com/s?wd=DeepSeek%E6%AD%A3%E5%BC%8F%E5%8F%91%E5%B8%83%E6%A8%A1%E5%9E%8B+%E5%AE%9A%E4%BB%B7%E4%B8%8B%E8%B0%83). Không có con số cụ thể trong dữ liệu xác nhận, nên bất kỳ ai nói "giảm 70%" hay "rẻ hơn GPT bao nhiêu lần" đều đang bịa. Nhưng hướng đi thì rõ, và hướng đi mới là thứ đáng bàn.
DeepSeek có tiền sử dùng giá làm vũ khí. Mỗi lần họ hạ giá, thị trường API lại phải chịu một đợt nén biên lợi nhuận. Với FP4 KV cache và Cross-Layer Attention Reuse trong tay, họ có cơ sở kỹ thuật để hạ giá mà không cần đốt tiền trợ giá — chi phí phục vụ mỗi token thực sự thấp hơn. Đó là khác biệt giữa một cuộc chiến giá bằng tiền đầu tư và một cuộc chiến giá bằng hiệu quả kiến trúc.
Với OpenAI, Anthropic, hay Google, đây là loại áp lực khó trả lời bằng thông cáo. Họ có thể hạ giá, nhưng hạ giá đồng nghĩa với việc chấp nhận biên lợi nhuận mỏng hơn trên hạ tầng GPU đắt đỏ. Hoặc họ có thể đẩy mạnh các dòng model cao cấp và để phân khúc giá rẻ lại cho DeepSeek — một nước đi phòng thủ hợp lý nhưng để mất thị phần volume.
Thực tế là phần lớn khối lượng API trên thế giới không phải suy luận phức tạp. Đó là phân loại, trích xuất, tóm tắt, viết lại, dịch. Loại tác vụ này không cần model đỉnh cao; nó cần model đủ tốt với giá đủ thấp. DeepSeek V4.1 Flash với 1M context và giá hạ nhắm thẳng vào phân khúc đó.
Vậy khi giá token tiến gần về 0 cho các tác vụ phổ thông, giá trị của một startup AI nằm ở đâu?
Có một nhóm hưởng lợi rõ ràng: các đội làm sản phẩm. Chi phí inference là dòng tiền lớn nhất trong P&L của phần lớn ứng dụng AI giai đoạn đầu. Giá giảm nghĩa là runway dài hơn, hoặc unit economics dương sớm hơn. Với một công ty ở Việt Nam đang bán sản phẩm theo mô hình subscription bằng VND nhưng trả chi phí API bằng USD, đây là tin tốt gấp đôi — vì còn được hưởng thêm lợi thế tỉ giá.
Nhóm chịu áp lực là các nhà cung cấp model tầm trung. Những lab chỉ có một dòng model duy nhất, không có lợi thế hạ tầng, không có hệ sinh thái enterprise, sẽ thấy mình kẹt giữa DeepSeek ở dưới và OpenAI ở trên. Mistral ở Pháp là ví dụ điển hình cho thế kẹt này, và họ buộc phải chọn ngách — chủ quyền dữ liệu châu Âu, model on-premise, hoặc các ngành dọc cụ thể.
Nhóm thứ ba, ít được nói tới: các công ty hạ tầng. Nếu một model 1M context chạy được với cache 4 bit, nhu cầu HBM và số lượng GPU cần thiết cho cùng một khối lượng request sẽ giảm. Điều đó không làm Nvidia mất khách — nó làm thay đổi cấu hình mua. Câu hỏi là các nhà cung cấp cloud có tính giá theo đúng mức tiết kiệm đó cho khách hàng hay giữ lại phần chênh.
Cross-Layer Attention Reuse, nếu được cộng đồng kiểm chứng và tái triển khai, có khả năng trở thành kỹ thuật phổ thông trong các inference engine như vLLM hay SGLang. Lúc đó, lợi thế của DeepSeek không còn là bí mật kỹ thuật mà chuyển thành lợi thế tốc độ và chi phí nắm bắt sớm. Đó là lý do tại sao bên cạnh thông báo chính thức, câu hỏi trên Zhihu mới đáng chú ý: cộng đồng kỹ thuật Trung Quốc thường mổ xẻ kiến trúc rất nhanh, và phản hồi ở đó là chỉ báo sớm về việc kỹ thuật này có đứng vững không (https://www.zhihu.com/question/2081380378493961583).
Nếu Cross-Layer Attention Reuse trở thành chuẩn mực trong vòng 6 tháng, lợi thế còn lại của DeepSeek là gì?
Nhìn vào thị trường Việt Nam cụ thể. Một startup SaaS ở Hà Nội xây trợ lý pháp lý cho doanh nghiệp nhỏ, bán gói 2-3 triệu đồng/tháng, hiện phải chunk tài liệu luật thành từng đoạn vì context ngắn. Với 1M token, họ có thể nhét cả một bộ văn bản pháp quy vào context và bỏ hẳn tầng retrieval phức tạp. Đó không phải cải tiến nhỏ — đó là bớt đi một module, một microservice, một nhóm lỗi tiềm ẩn.
Nhưng cũng có cái bẫy cho đội Việt Nam. Nhét hết vào context nghĩa là mỗi request trả tiền cho 1M token đầu vào, kể cả khi chỉ cần tra một điều khoản. Với tác vụ tra cứu hẹp, RAG truyền thống vẫn rẻ hơn nhiều bậc. Ngữ cảnh dài không thay thế retrieval — nó mở ra một lớp tác vụ khác, nơi câu hỏi cần cái nhìn tổng thể thay vì tra cứu điểm.
Ở các công ty lớn hơn như Viettel, VNG hay FPT, câu chuyện lại khác. Họ có hạ tầng riêng, có nhu cầu chủ quyền dữ liệu, và phần lớn không thể gửi dữ liệu khách hàng ra API nước ngoài. Với họ, DeepSeek V4.1 Flash có giá trị ở tầng kỹ thuật: các kỹ thuật như FP4 KV cache và Cross-Layer Attention Reuse là thứ đáng học để áp lên model nội bộ. Nếu một model 7B hay 13B nội bộ được tối ưu cache theo cách tương tự, chi phí vận hành trên một cụm GPU ở Việt Nam giảm đáng kể — và đó là dòng tiền ở lại trong nước.
Cũng cần nói thẳng: phần lớn dev Việt đang dùng API của OpenAI, Anthropic hoặc Google thông qua các công cụ như Cursor và Claude Code. Việc một model như V4.1 Flash xuất hiện với giá thấp hơn và context dài hơn tạo ra lựa chọn thực sự cho các tác vụ batch — sinh test, refactor hàng loạt,