Cơ bản
Giao ngay
Giao dịch tiền điện tử một cách tự do
Giao dịch ký quỹ
Tăng lợi nhuận của bạn với đòn bẩy
Chuyển đổi và Đầu tư định kỳ
0 Fees
Giao dịch bất kể khối lượng không mất phí không trượt giá
ETF
Sản phẩm ETF có thuộc tính đòn bẩy giao dịch giao ngay không cần vay không cháy tải khoản
Giao dịch trước giờ mở cửa
Giao dịch token mới trước niêm yết
Futures
Truy cập hàng trăm hợp đồng vĩnh cửu
CFD
Vàng
Một nền tảng cho tài sản truyền thống
Quyền chọn
Hot
Giao dịch với các quyền chọn kiểu Châu Âu
Tài khoản hợp nhất
Tối đa hóa hiệu quả sử dụng vốn của bạn
Giao dịch demo
Giới thiệu về Giao dịch hợp đồng tương lai
Nắm vững kỹ năng giao dịch hợp đồng từ đầu
Sự kiện tương lai
Tham gia sự kiện để nhận phần thưởng
Giao dịch demo
Sử dụng tiền ảo để trải nghiệm giao dịch không rủi ro
CFD
Phái sinh Hợp đồng Chênh lệch Cổ phiếu
Cổ phiếu Hoa Kỳ
Tiếp cận cổ phiếu và quỹ ETF thực của Hoa Kỳ
Cổ phiếu Hongkong
Giao dịch cổ phiếu chất lượng được niêm yết tại Hongkong
Cổ phiếu Hàn Quốc
SK Hynix
Giao dịch cổ phiếu Hàn Quốc thực và đầu tư vào các tài sản phổ biến
Futures cổ phiếu
Đòn bẩy cao, giao dịch 24/7
Cổ phiếu token hóa
Được hỗ trợ bởi tài sản cổ phiếu thực
IPO Access
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
GUSD
3.8%
Đúc GUSD để nhận lợi suất từ RWA kho bạc
Hoạt động cổ phiếu
Giao dịch cổ phiếu phổ biến và nhận airdrop hấp dẫn
Launch
CandyDrop
Sưu tập kẹo để kiếm airdrop
Launchpool
Thế chấp nhanh, kiếm token mới tiềm năng
HODLer Airdrop
Nắm giữ GT và nhận được airdrop lớn miễn phí
Pre-IPOs
Mở khóa quyền truy cập đầy đủ vào các IPO cổ phiếu toàn cầu
Điểm Alpha
Giao dịch trên chuỗi và nhận airdrop
Điểm Futures
Kiếm điểm futures và nhận phần thưởng airdrop
Đầu tư
Simple Earn
Kiếm lãi từ các token nhàn rỗi
Đầu tư tự động
Đầu tư tự động một cách thường xuyên.
Sản phẩm tiền kép
Kiếm lợi nhuận từ biến động thị trường
Soft Staking
Kiếm phần thưởng với staking linh hoạt
Vay Crypto
0 Fees
Thế chấp một loại tiền điện tử để vay một loại khác
Trung tâm cho vay
Trung tâm cho vay một cửa
Trung tâm tài sản VIP
Kế hoạch tăng trưởng tài sản cao cấp
Gate Wealth
Nắm quyền kiểm soát tương lai tài chính của bạn
Quỹ định lượng
Chiến lược định lượng hàng đầu
Staking
Stake tiền điện tử để kiếm tiền từ các sản phẩm PoS
Đòn bẩy thông minh
Đòn bẩy không thanh lý
GUSD
3.8%
Nạp & đổi bất cứ lúc nào, miễn phí đổi
Khuyến mãi
AI
Gate AI
Trợ lý AI đa năng đồng hành cùng bạn
Gate AI Bot
Sử dụng Gate AI trực tiếp trong ứng dụng xã hội của bạn
GateClaw
Gate Tôm hùm xanh, mở hộp là dùng ngay
Gate for AI Agent
Hạ tầng AI, Gate MCP, Skills và CLI
Gate Skills Hub
Hơn 10.000 kỹ năng
Từ văn phòng đến giao dịch, thư viện kỹ năng một cửa giúp AI tiện lợi hơn
Kimi K3: Càng chip rẻ càng thiếu? Hiệu suất tăng vọt kéo theo nhu cầu phần cứng tăng vọt
Kimi K3 降 giá sẽ không làm giảm nhu cầu chip, ngược lại còn có thể đẩy mức tiêu thụ phần cứng tổng thể lên cao hơn。
(Bối cảnh trước đó: Ngưỡng phần cứng để chạy Kimi K3 tại chỗ? Từ 64 GPU trở đi, mức tiêu thụ điện 45kW, game thủ tự dựng cấu hình sẽ tự gặp giới hạn)
(Bổ sung bối cảnh: Quy mô giao dịch nhìn ở mức 100 tỷ USD! Tin rằng Anthropic dự kiến thuê tài nguyên tính toán từ Meta để giảm khủng hoảng thiếu GPU)
Mục lục bài viết
Toggle
Kimi K3 đưa các nhà đầu tư AI quay trở lại một câu hỏi cốt lõi: mô hình rẻ hơn, hiệu quả hơn—liệu có đồng nghĩa nhu cầu chip và bộ nhớ sẽ giảm? Câu trả lời của Citi và Ngân hàng Mỹ (Bank of America) đều nghiêng về hướng phủ định; việc nâng cao hiệu suất có thể lại giải phóng nhiều nhu cầu sử dụng hơn, từ đó đẩy tổng mức tiêu hao tài nguyên tăng lên.
Theo sàn giao dịch “đuổi theo tin” (theo đà), Kimi K3 do Mặt trăng tối (Moon of the Dark Side) công bố có 2,8 nghìn tỷ tham số, nhắm tới cửa sổ ngữ cảnh 1 triệu token và các nhiệm vụ tác nhân trí tuệ dài hạn. Nhà phân tích bán dẫn của Citi, Peter Lee, cho rằng dù Kimi K3 được sử dụng rộng rãi, nhu cầu bộ nhớ dùng chung như máy chủ DDR5 và eSSD vẫn sẽ tăng.
Nhà phân tích bán dẫn của Ngân hàng Mỹ, Vivek Arya, trong nghiên cứu ngày 17 tháng 7 cũng cho biết các phòng thí nghiệm AI tiên tiến của Mỹ thậm chí có thể tăng mức đầu tư sức mạnh tính toán, thay vì giảm. Nếu các mô hình mã nguồn mở của Trung Quốc tiếp tục tiến gần, các đối thủ dẫn đầu như OpenAI, Anthropic và Google sẽ buộc phải dùng quy mô huấn luyện lớn hơn, đẩy mạnh suy luận và cập nhật sản phẩm nhanh hơn để duy trì khác biệt.
Điều này có nghĩa logic định giá của thị trường đối với Kimi K3 không thể chỉ nhìn vào việc chi phí suy luận cho một lần giảm. Quan trọng hơn là liệu mô hình giá rẻ có kéo theo nhiều cuộc gọi hơn, chuỗi tác vụ dài hơn và sinh ra nhiều token hơn hay không. Nếu câu trả lời là có, GPU, HBM, DDR5, eSSD, mạng tốc độ cao và hệ thống suy luận đều có thể tiếp tục được hưởng lợi.
Kimi K3 ra mắt: Hiệu suất bùng nổ kéo ngược lại nhu cầu phần cứng
Citi xem Kimi K3 như một kịch bản tiềm năng của “nghịch lý Jevons” trong chuỗi ngành AI. Cốt lõi của nghịch lý này là: khi hiệu quả công nghệ làm giảm chi phí sử dụng trên một đơn vị, lượng sử dụng có thể tăng mạnh, và cuối cùng tổng mức tiêu hao tài nguyên không giảm mà còn tăng.
Sức hút của Kimi K3 đến từ sự kết hợp giữa chi phí thấp và hiệu năng cao. Theo giá công khai, giá cho đầu vào khi cache hit là 0,3 USD cho mỗi 1 triệu token, còn giá cho đầu ra là 15 USD cho mỗi 1 triệu token. Kế hoạch trọng số đầy đủ sẽ được công bố vào ngày 27 tháng 7, mục tiêu là hỗ trợ công việc cho các tác nhân trí tuệ theo chu kỳ dài.
Nhận định của Citi là việc hạ giá mô hình không tự động làm giảm nhu cầu phần cứng. Ngược lại, chi phí thấp có thể tăng ý nguyện của nhà phát triển và doanh nghiệp khi gọi mô hình, thúc đẩy việc triển khai thêm nhiều tác nhân AI. Nhiệm vụ của trí tuệ (tác nhân) không phải dạng hỏi đáp một lần, mà là liên tục sinh ra trong chuỗi nhiệm vụ, đọc và xử lý token. Số lần gọi và độ dài nhiệm vụ tăng lên sẽ chuyển lại mức giảm chi phí đơn vị thành tổng mức tiêu hao tài nguyên.
Vì vậy, tác động của Kimi K3 lên chuỗi bán dẫn không nằm ở việc “một lần gọi có rẻ hơn không”, mà nằm ở “tổng lượng token có tăng lên hay không”. Đây chính là lý do Citi đánh giá tích cực nhu cầu DDR5 và eSSD của máy chủ.
Nghịch lý Jevons: Giá thấp kích hoạt nhiều hơn lượng token tiêu thụ
Kimi K3 sử dụng ba công nghệ then chốt: Kimi Delta Attention, Attention Residuals và Stable LatentMoE. Kimi Delta Attention dùng để giảm chi phí cho cửa sổ ngữ cảnh 1 triệu token; Attention Residuals dùng để chọn lọc truy xuất biểu diễn giữa các độ sâu khác nhau của mô hình; Stable LatentMoE nâng mức độ thưa (sparsity), với mỗi token chỉ kích hoạt 16 chuyên gia trong số 896 chuyên gia.
Tài liệu kỹ thuật của Mặt trăng tối cho biết kiến trúc này giúp hiệu suất mở rộng của Kimi K3 đạt 2,5 lần K2. Mức độ thưa cao và năng lực ngữ cảnh dài là nền tảng quan trọng giúp hạ chi phí thực thi.
Tuy nhiên, Citi nhấn mạnh điều này không đồng nghĩa áp lực tài nguyên ở đầu suy luận biến mất. Kimi K3 vẫn không phải là phương án triển khai nhẹ; việc chạy đòi hỏi cụm nhiều nút, với cấu hình “siêu nút” vượt quá 64 GPU. Quan trọng hơn, ngữ cảnh dài và nhiệm vụ tác nhân sẽ làm tăng mức chiếm dụng KV Cache, qua đó nâng gánh nặng bộ nhớ ở đầu suy luận.
Nhu cầu KV Cache liên quan trực tiếp đến DDR5 và eSSD của máy chủ. DDR5 đảm nhiệm truy cập dữ liệu tần suất cao, còn eSSD hưởng lợi từ nhu cầu cache và lưu trữ dữ liệu lớn hơn. Với nhà sản xuất bộ nhớ, biến số then chốt không phải là một mô hình riêng lẻ có tiết kiệm compute hay không, mà là sau khi hạ giá thì mô hình được gọi bao nhiêu lần, mỗi lần gọi sinh ra bao nhiêu token và chuỗi nhiệm vụ tác nhân được kéo dài đến đâu.
KV Cache tăng vọt: Bối cảnh dài “ép” bộ nhớ
Kết luận của Ngân hàng Mỹ tương đồng với Citi, nhưng trọng tâm nghiêng nhiều hơn về GPU và cơ sở hạ tầng AI. Vivek Arya cho rằng mô hình mã nguồn mở mạnh hơn của Trung Quốc chưa chắc sẽ khiến các “đại gia AI” Mỹ cắt giảm đầu tư sức mạnh tính toán. Ngược lại, khoảng cách mô hình thu hẹp sẽ làm tăng chi phí để các bên dẫn đầu duy trì ưu thế.
Ngân hàng Mỹ cho biết nếu các mô hình mã nguồn mở tiếp tục áp sát, OpenAI, Anthropic và Google sẽ phải dựa vào quy mô huấn luyện lớn hơn, nhiều vòng lặp học tăng cường và dữ liệu tổng hợp hơn, suy luận lúc thử nghiệm nặng hơn và nhịp độ phát hành sản phẩm nhanh hơn để giữ vững khác biệt.
Chuỗi lập luận này không phụ thuộc vào việc mô hình nào dẫn đầu trong ngắn hạn. Bảng xếp hạng mô hình lớn có thể thay phiên nhanh, nhưng thứ doanh nghiệp thật sự mua là đầu ra AI ổn định, độ trễ thấp, độ sẵn sàng cao, cùng chi phí “trên mỗi đơn vị sản lượng hiệu quả” thấp hơn. Khi năng lực mô hình tiệm cận nhau, áp lực cạnh tranh sẽ lan sang tầng cơ sở hạ tầng bên dưới, gồm GPU, HBM, mạng tốc độ cao và hệ thống suy luận.
Vì vậy, Ngân hàng Mỹ cho rằng sự xuất hiện của các mô hình như Kimi K3 không nên bị hiểu đơn giản là “mô hình hiệu quả hơn thì cần ít chip hơn”. Con đường thực tế hơn là cạnh tranh mô hình khốc liệt hơn, và các bên dẫn đầu phải tiếp tục tăng đầu tư sức mạnh tính toán để duy trì khoảng cách.
Cạnh tranh đóng băng: Các đại gia AI Mỹ vẫn tiếp tục tăng tốc
Kimi K3 dùng kiến trúc MoE, nghĩa là tổng số tham số và lượng tham số thực sự được kích hoạt mỗi lần suy luận có thể tách rời. Thay đổi này làm giảm một phần áp lực tính toán, nhưng đồng thời chuyển “cổ chai” hạ tầng từ chỉ đơn thuần là sức mạnh tính toán sang truy cập bộ nhớ video, định tuyến chuyên gia, độ trễ phản hồi và năng lực liên kết (interconnect).
Ngân hàng Mỹ nhấn mạnh rằng suy luận MoE đòi hỏi hệ thống vận chuyển dữ liệu hiệu quả hơn, lập lịch các module chuyên gia, và kết nối với cụm tính toán lớn hơn. Nvidia cho rằng suy luận MoE hiện đại cần một vùng GPU lớn hơn. Các phép tính của họ cho thấy hiệu năng mỗi watt của GB300 NVL72 trên các mô hình mã nguồn mở dẫn đầu có thể đạt tới 25 lần so với nền tảng Hopper.
CoreWeave cũng cho thấy qua thử nghiệm quanh Kimi K2.6 rằng dù mô hình MoE mã nguồn mở chỉ kích hoạt một phần tham số mỗi lần, nếu muốn duy trì vị thế dẫn đầu về tốc độ và hiệu quả chi phí, vẫn cần cơ sở hạ tầng Nvidia GB300/GB200 NVL72 được tối ưu hóa.
Điều này có nghĩa là trọng số mô hình có thể dần trở nên “hàng hóa”, nhưng các GPU, bộ nhớ băng thông cao, khả năng liên kết mạng và hệ thống suy luận cần để chạy mô hình sẽ không mất giá trị. Ngược lại, khi lượng cuộc gọi mô hình tăng lên, các khâu này có thể trở thành nơi cạnh tranh tập trung hơn.
Mua mạnh mã nguồn mở: Dữ liệu OpenRouter cho thấy tăng trưởng
Ngân hàng Mỹ cũng trích dẫn dữ liệu OpenRouter để cho thấy lượng gọi mô hình vẫn đang tăng nhanh. Là nền tảng API bên thứ ba kết nối nhiều phòng thí nghiệm mô hình, token sử dụng trên OpenRouter tiếp tục đi lên; trong đó lượng token của các mô hình từ các phòng thí nghiệm AI Trung Quốc đã vượt lượng token của các phòng thí nghiệm không phải Trung Quốc.
Dữ liệu này không thể đại diện trực tiếp cho mọi kịch bản doanh nghiệp và người tiêu dùng, nhưng ít nhất nó cho thấy lựa chọn của nhà phát triển trong hệ sinh thái mô hình mở đang thay đổi. Giá mô hình giảm và năng lực tăng có thể thúc đẩy lượng gọi tiếp tục mở rộng, thay vì bị “triệt tiêu” bởi việc hiệu quả của một mô hình đơn lẻ tăng lên.
Việc sử dụng trả phí của doanh nghiệp cũng đang tăng. Dữ liệu của Ramp cho thấy đến tháng 6 năm 2026, khoảng 55% doanh nghiệp Mỹ đã trả phí để đăng ký các mô hình AI trên các nền tảng hoặc công cụ; con số này cao hơn mức 21% ước tính từ khảo sát BTOS của Cục Điều tra Dân số Hoa Kỳ. Theo từng mô hình, tỷ lệ doanh nghiệp dùng Anthropic là 42,4%, còn OpenAI là 39,5%.
Kết luận: Kimi K3 trở thành chất xúc tác phần cứng
Tuy nhiên, chi tiêu cho AI vẫn bị tập trung cao. Top 1% người dùng doanh nghiệp có chi tiêu AI trung bình khoảng 4.833 USD mỗi nhân viên mỗi tháng, nhóm top 10% là 516 USD, còn trung vị toàn ngành chỉ 11 USD. Tỷ lệ đăng ký trong ngành công nghệ và truyền thông đạt 79,8%, tỷ lệ doanh nghiệp lớn dùng là 65,5%, cao hơn doanh nghiệp tầm trung 61,3% và doanh nghiệp nhỏ 48,7%.
Bộ dữ liệu này ủng hộ một nhận định: việc sử dụng AI vẫn đang trong quá trình lan rộng. Nếu mô hình giá rẻ hạ thấp rào cản gia nhập, nhu cầu tăng thêm trong tương lai có thể đến từ nhiều doanh nghiệp hơn, nhiều nhà phát triển hơn và nhiều ứng dụng tác nhân hơn.
Kết luận chung của Citi và Ngân hàng Mỹ là ý nghĩa của Kimi K3 không nằm ở việc một mô hình đơn lẻ có hạ chi phí suy luận trên một đơn vị hay không, mà nằm ở việc chi phí thấp có giải phóng khối lượng công việc theo quy mô lớn hơn hay không.
Với Citi, hướng hưởng lợi trực tiếp nhất là máy chủ DDR5 và eSSD. Ngữ cảnh dài, KV Cache và nhiệm vụ tác nhân sẽ làm tăng nhu cầu truy cập và lưu trữ bộ nhớ. Với Ngân hàng Mỹ, quan trọng hơn là GPU, HBM, mạng tốc độ cao và hệ thống suy luận, vì cạnh tranh mô hình sẽ buộc các bên dẫn đầu tiếp tục đầu tư vào cơ sở hạ tầng.
Ngân hàng Mỹ cũng nhắc rằng Kimi K3 liên quan tới “45 nanomet mã nguồn mở EDA” không nên bị hiểu đơn giản là EDA thương mại bị thay thế. Ngược lại, điều này cho thấy thiết kế chip vẫn không thể thiếu công cụ EDA. Ở các tiến trình sản xuất tiên tiến, các hãng EDA thương mại như Cadence và Synopsys vẫn giữ vị trí then chốt.
Rủi ro nằm ở kịch bản khác: nếu việc nén mô hình khiến tối ưu suy luận và cải thiện hiệu suất phần cứng diễn ra nhanh hơn so với việc tăng thêm khối lượng công việc dài hạn, thì sự mở rộng của cơ sở hạ tầng AI có thể hạ nhiệt theo từng giai đoạn. Nhưng trong khung phân tích của hai ngân hàng đầu tư này, Kimi K3 giống như một chất xúc tác đẩy tăng lượng sử dụng hơn là một tín hiệu làm suy yếu nhu cầu chip. Sau khi hiệu suất được nâng lên, thị trường phải tập trung vào nhiều token hơn, nhiều suy luận hơn và nhiều tiêu hao phần cứng tầng dưới hơn.