Letm Blog
  1. Home
  2. Posts
  3. Mixture of Experts (MoE) - Mô hình hỗn hợp chuyên gia làm tăng giá RAM thế nào

Mixture of Experts (MoE) - Mô hình hỗn hợp chuyên gia làm tăng giá RAM thế nào

Jul 3, 2026 AI , LLM

Khi “Mẹo” Tối Ưu AI Trở Thành Kẻ Thôn Tính Bộ Nhớ Toàn Cầu

Nếu bạn cố gắng mua thêm RAM cho máy tính hoặc nâng cấp máy chủ vào lúc này, bạn sẽ nhận ra một thực tế phũ phàng: Giá bộ nhớ đã tăng gần gấp đôi kể từ đầu năm 2025. Micron – một trong ba ông lớn sản xuất phần lớn lượng RAM trên thế giới – thậm chí đã cháy hàng cho đến hết năm 2026. Hiện tại, các trung tâm dữ liệu AI đang nuốt chửng tới 70% lượng chip nhớ được sản xuất trên toàn cầu.

Vì sao lại có cuộc khủng hoảng này? Câu trả lời không chỉ đơn giản là “AI cần nhiều bộ nhớ”. Thủ phạm thực sự đứng sau sự bùng nổ này là một bước chuyển dịch lớn trong kiến trúc mô hình: Mixture of Experts (MoE) - Mô hình hỗn hợp chuyên gia.

Kiến trúc này ban đầu được sinh ra như một “mẹo” thông minh để giúp AI chạy rẻ hơn, nhưng cuối cùng, nó lại biến bộ nhớ trở thành tài nguyên bị tranh giành khốc liệt nhất trong lịch sử điện toán.


Bản giao kèo của MoE: Tách rời Tham số và Điện toán

Trong các mô hình AI truyền thống (mô hình đặc - Dense model), mỗi khi bạn nhập vào một từ (token), toàn bộ mạng lưới thần kinh đều phải thức dậy và hoạt động. Muốn mô hình thông minh hơn (nhiều tham số hơn), bạn phải chấp nhận hóa đơn tiền điện và chi phí xử lý (compute) tăng lên tỷ lệ thuận.

MoE đã phá vỡ quy luật đó. Nó tách biệt hai khái niệm:

  1. Tổng số tham số (Total Parameters): Toàn bộ kho tri thức mà mô hình có thể lưu trữ.
  2. Tham số kích hoạt (Active Parameters): Lượng tài nguyên thực sự tiêu tốn để xử lý cho mỗi token.

Thay vì bắt mọi neuron làm việc, MoE chia tầng xử lý (Feed-Forward Network) thành một “kệ” chứa hàng chục, hàng trăm “chuyên gia” nhỏ (experts). Khi một token đi qua, một bộ định tuyến (router) sẽ quét nhanh và chỉ chọn ra một vài chuyên gia phù hợp nhất để kích hoạt.

Mô hình Mixtral 8x7B chính là ví dụ kinh điển khiến giới lập trình chú ý đến MoE. Nó sở hữu tổng cộng 47 tỷ tham số, nhưng với mỗi token, nó chỉ kích hoạt khoảng 13 tỷ tham số. Bạn có một kho tri thức khổng lồ của mô hình 47B nhưng chỉ phải trả chi phí vận hành (compute) tương đương mô hình 13B.

Cái bẫy nằm ở đây: Chi phí xử lý thì nhỏ, nhưng cái “tủ chứa chuyên gia” thì khổng lồ. Và tất cả các chuyên gia – dù đang ngủ hay đang thức – đều bắt buộc phải nằm sẵn trong bộ nhớ (RAM/VRAM) để sẵn sàng bị đánh thức bất cứ lúc nào.


Vì sao không thể “cất” các chuyên gia vào ổ cứng?

Nhiều người nghĩ: “Nếu chuyên gia nào không dùng đến, tại sao không đẩy tạm xuống ổ cứng (Disk) cho đỡ chật RAM?”

Thực tế phức tạp hơn nhiều. Thuật ngữ “chuyên gia” dễ làm chúng ta liên tưởng đến những bộ óc có nhãn mác rõ ràng: ông chuyên toán, ông chuyên code, ông chuyên làm thơ. Nhưng trong AI, các chuyên gia chỉ là các khối toán học được hình thành ngẫu nhiên qua quá trình huấn luyện.

Quan trọng hơn, quyết định định tuyến được thực hiện theo thời gian thực (Dynamic Routing). Bộ định tuyến không hề biết từ tiếp theo trong câu là gì cho đến khi nó thực sự nhìn thấy từ đó. Nghĩa là trong tích tắc mili-giây, hệ thống phải có sẵn tất cả các công cụ ngay trong tầm tay. Bạn không thể dự đoán trước để “tải” chuyên gia từ ổ cứng lên RAM kịp tốc độ xử lý.

Đây cũng là lý do vì sao chuyên gia Jeremy Howard từng thẳng thắn chia sẻ trên Twitter: MoE là cơn ác mộng đối với người dùng GPU rời (như Nvidia RTX 3090/4090) nhưng lại là vị cứu tinh cho các máy cấu trúc bộ nhớ hợp nhất (Unified Memory) như Mac Apple Silicon.

Một chiếc RTX 3090 chỉ có 24GB VRAM tốc độ cao – hoàn toàn bất lực trước các mô hình MoE lớn. Trong khi đó, một chiếc Mac Studio có thể nâng cấp lên hơn 128GB bộ nhớ hợp nhất, “gánh” mượt mà đống chuyên gia đang ngủ đó mà không sợ tràn bộ nhớ.


Cuộc đua tối ưu phần cứng từ hai đầu chiến tuyến

Để giải quyết bài toán nghẽn cổ chai bộ nhớ, thế giới AI đang chia làm hai ngả đường để tìm cách tối ưu:

1. Tối ưu từ bên trong kiến trúc (Điển hình là DeepSeek)

DeepSeek (với phiên bản V2/V3) đã chọn cách tiếp cận cực kỳ thông minh: thay vì chia thành các chuyên gia lớn, họ băm nhỏ các chuyên gia ra mịn hơn nữa (Fine-grained experts) để bộ định tuyến phối hợp linh hoạt hơn.

Đồng thời, họ thiết kế các Chuyên gia chia sẻ (Shared Experts) luôn luôn bật để xử lý các kiến thức nền tảng phổ thông. Điều này giúp các chuyên gia chuyên sâu không bị lãng phí bộ nhớ để học lại những thứ cơ bản. Kết quả? DeepSeek V2 đạt tổng 236 tỷ tham số nhưng chỉ kích hoạt 21 tỷ tham số, cắt giảm 42% chi phí huấn luyện và tăng tốc độ xử lý gấp gần 6 lần.

Theo bước chân này, các ông lớn khác cũng đang cược tất tay vào các mô hình “khủng long” MoE:

  • Grok 2: ~1 nghìn tỷ tham số (chỉ kích hoạt 32 tỷ).
  • Qwen 3: 235 tỷ tham số (chỉ kích hoạt 22 tỷ).
  • Llama 4 Maverick: Khoảng 400 tỷ tham số (chỉ kích hoạt 17 tỷ).

2. Ép cân phần cứng và kỹ thuật Stream từ SSD

Vào cuối năm 2023, Apple từng công bố bài báo gây chú ý mang tên “LLM in a flash”. Ý tưởng là giữ các trọng số (weights) của mô hình trên ổ cứng SSD và dùng các thuật toán dự đoán (windowing, row-column bundling) để stream chúng vào RAM theo dạng các khối lớn khi cần. Kỹ thuật này giúp bạn chạy được mô hình có kích thước lớn gấp đôi dung lượng RAM vật lý đang có.

Mới đây, một lập trình viên thậm chí đã chạy thành công mô hình Qwen MoE 397 tỷ tham số trên một chiếc MacBook Pro chỉ có 48GB RAM nhờ phương pháp này.

Tuy nhiên, đời không như là mơ. Một nghiên cứu đối nghịch vào năm 2025 chỉ ra rằng: Việc ép mô hình chạy từ SSD có thể làm tăng mức tiêu thụ năng lượng trên mỗi token lên tới 12 lần so với việc giữ mọi thứ trên bộ nhớ băng thông cao (HBM/DRAM). Kỹ thuật này giải quyết được bài toán dung lượng (Capacity) nhưng lại tạo ra một thảm họa về hiệu suất năng lượng (Efficiency).


Lời kết

Hành trình của MoE là một vòng lặp đầy trớ trêu của công nghệ. Nó bắt đầu từ một ý tưởng năm 1991 của Geoffrey Hinton về sự chuyên hóa (Specialization). Đến năm 2017, Noam Shazier và đội ngũ Google biến nó thành một “mẹo” để mở rộng quy mô (Scaling trick) nhằm tạo ra các mô hình siêu lớn mà không tốn thêm chi phí điện toán.

Nhưng bản giao kèo nào cũng có giá của nó. Kiến trúc sinh ra để giúp AI trở nên “rẻ hơn” rốt cuộc lại biến bộ nhớ trở thành thứ tài nguyên đắt đỏ và khan hiếm nhất hành tinh. Cho đến nay, MoE vẫn là một canh bạc lớn của ngành công nghệ: Canh bạc mang tên tách rời “Năng lực xử lý” khỏi “Năng lượng tính toán”, và kỳ vọng rằng chuỗi cung ứng toàn cầu sẽ sản xuất kịp RAM để nạp mạng sống cho những “chuyên gia” đang ngủ yên.

AI Apple Silicon computational cost data centers DeepSeek dynamic routing energy efficiency GPU hardware optimization machine learning memory crisis Mixture of Experts model architecture MoE neural networks RAM technology trends.

Table of Contents

  • Bản giao kèo của MoE: Tách rời Tham số và Điện toán
  • Vì sao không thể “cất” các chuyên gia vào ổ cứng?
  • Cuộc đua tối ưu phần cứng từ hai đầu chiến tuyến
    • 1. Tối ưu từ bên trong kiến trúc (Điển hình là DeepSeek)
    • 2. Ép cân phần cứng và kỹ thuật Stream từ SSD
  • Lời kết
← Trí tuệ không phải là những gì bạn biết, mà là việc bạn làm khi không biết Chuỗi Markov: Từ Quả Bom Nguyên Tử Đến Thuật Toán Google →

Related Posts

  • NILM metrics May 7, 2026
  • Nvidia CEO Jensen Huang nói về tương lai AI May 7, 2026
Powered by Hugo & Explore Theme.