Qwen là gì?
Qwen là họ mô hình AI do Alibaba Cloud phát triển từ năm 2023, gồm bản ngôn ngữ, bản đa phương thức, bản chuyên code và nhiều phiên bản mở trọng số.
Tên tiếng Trung của Qwen là Tongyi Qianwen (通义千问), hiểu nôm na là "ngàn câu hỏi". Alibaba giới thiệu dòng này sau làn sóng ChatGPT, nhưng đi theo hướng khác: thay vì một sản phẩm đóng duy nhất, Qwen được xây như một họ mô hình nhiều kích cỡ, nhiều nhánh chuyên môn.
Kiến trúc lõi vẫn là Transformer, huấn luyện trên khối dữ liệu đa ngôn ngữ cỡ hàng chục nghìn tỷ token. Riêng Qwen3 được huấn luyện trên khoảng 36 nghìn tỷ token, gần gấp đôi Qwen2.5.
Điểm khiến Qwen được nhắc nhiều ở Việt Nam không phải là điểm benchmark. Đó là chuyện phần lớn mô hình Qwen được mở trọng số theo giấy phép Apache 2.0, tức bạn tải về, fine-tune, chạy trên hạ tầng riêng và dùng thương mại được.
Qwen đã đi qua những thế hệ nào?
Qwen trải qua bốn giai đoạn lớn: Qwen1.x, Qwen2.5, Qwen3 với hybrid reasoning và từ năm 2026 là loạt Qwen3.5 cho tới Qwen3.8-Max.
| Thế hệ |
Thời điểm |
Điểm đáng chú ý |
| Qwen1.x |
2023 |
Bản base và Qwen-Chat, các mức 1.8B đến 72B, context 32K token |
| Qwen2 - Qwen2.5 |
2024 |
Cải thiện suy luận, hiểu code, chất lượng viết |
| Qwen3 |
4/2025 |
Hybrid reasoning, 6 bản dense 0.6B-32B, 2 bản MoE 30B-A3B và 235B-A22B, 119 ngôn ngữ |
| Qwen3.5 |
2/2026 |
Bản mở 397B-A17B, đa phương thức gốc, 201 ngôn ngữ và phương ngữ |
| Qwen3.6 - Qwen3.7 |
4-5/2026 |
Các bản 27B, 35B-A3B và Qwen3.7-Max |
| Qwen3.8-Max |
3/8/2026 |
2.4 nghìn tỷ tham số, khoảng 95 tỷ tham số kích hoạt, context 1 triệu token |
Nhìn bảng này bạn sẽ thấy nhịp ra mắt của Alibaba nhanh đến mức khó theo dõi. Trong khoảng sáu tháng đầu năm 2026 đã có ít nhất bốn mốc phát hành đáng kể.
Một chi tiết dễ gây nhầm: Qwen 3.8 không phải Qwen3-8B. Cái đầu là mô hình 2.4 nghìn tỷ tham số, cái sau là bản dense 8 tỷ tham số chạy được trên máy chủ nhỏ. Đặt tên kiểu này thì lỗi gõ nhầm một dấu chấm cũng đủ khiến team dev tải nhầm file 400GB.
Qwen3.5 có gì khác các thế hệ trước?
Qwen3.5 ra mắt tháng 2/2026 với bản mở trọng số 397 tỷ tham số, chỉ kích hoạt 17 tỷ mỗi token, hỗ trợ 201 ngôn ngữ và xử lý được cả video.
Đây là thế hệ đầu tiên của Qwen có đa phương thức gốc, tức xử lý văn bản, hình ảnh và video trong cùng một luồng hội thoại thay vì ghép nhiều mô hình lại. Alibaba cho biết mô hình đọc được video dài tới hai giờ.
Về ngôn ngữ, con số nhảy từ 119 lên 201 ngôn ngữ và phương ngữ. Bộ từ vựng cũng mở rộng lên 250.000 token, giúp tốc độ xử lý nhiều ngôn ngữ nhanh hơn đáng kể.
Context window native của cả dòng 3.5 là 256K token, còn bản hosted Qwen3.5-Plus trên Model Studio hỗ trợ tới 1 triệu token.
Điểm cần tỉnh táo: các bảng benchmark so sánh Qwen3.5 với GPT-5.2, Claude Opus 4.5 hay Gemini 3 Pro đều do Alibaba tự công bố. Báo chí quốc tế đã ghi rõ họ không tự kiểm chứng được các con số này. Bạn nên coi đó là tuyên bố marketing cho tới khi bên thứ ba chạy lại.
Qwen3.8-Max mạnh đến mức nào?
Qwen3.8-Max ra mắt ngày 3/8/2026 với 2.4 nghìn tỷ tham số, khoảng 95 tỷ tham số kích hoạt mỗi token và cửa sổ ngữ cảnh 1 triệu token.
Kiến trúc Sparse Mixture-of-Experts là lý do mô hình khổng lồ này vẫn chạy được với chi phí chấp nhận được. Nói dễ hiểu: công ty có 2.400 nhân sự trên danh sách, nhưng mỗi cuộc họp chỉ gọi đúng 95 người có chuyên môn vào phòng. Bảng lương thì to, chi phí mỗi cuộc họp thì không.
Alibaba định vị mô hình này cho tác vụ dài hơi: agent code quy mô repository, kho tri thức từ tài liệu dài, lập chỉ mục video dài và trợ lý nghiên cứu nhiều bước. Đầu ra tối đa 131.072 token mỗi phản hồi.
Về benchmark, Alibaba công bố Qwen3.8-Max đạt 86.6 trên Terminal-Bench 2.1 và 86.1 trên OSWorld-Verified, nhưng lại kém rõ rệt ở SWE-bench Pro và FrontierSWE so với các mô hình đầu bảng. Mức tăng chủ yếu nằm ở nhóm đa phương thức và agentic, không phải suy luận thuần.
Giá API được một số nguồn thứ cấp ghi nhận khoảng 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra.
Qwen có những dòng mô hình chuyên biệt nào?
Ngoài bản chat, Qwen có Qwen-VL cho hình ảnh, Qwen-Audio cho âm thanh, Qwen-Coder cho lập trình và Qwen-Math cho các bài toán suy luận.
- Qwen-VL: đọc ảnh, tài liệu scan, biểu đồ, giao diện web. Dùng nhiều cho số hóa hồ sơ và trích xuất dữ liệu từ chứng từ.
- Qwen-Audio: xử lý giọng nói và âm thanh. Dòng Qwen3-ASR-Flash hỗ trợ 11 ngôn ngữ với tự động nhận diện ngôn ngữ.
- Qwen-Coder: bản flagship Qwen3-Coder là MoE 480 tỷ tham số với 35 tỷ kích hoạt, context native 256K token.
- Qwen-Math và các bản reasoning như Qwen3-Max-Thinking: hiển thị chuỗi lập luận cho bài toán khó.
Với một team marketing Việt Nam, dòng đáng quan tâm nhất thường là Qwen-VL và Qwen-Coder. Một bên giúp bạn bóc dữ liệu từ ảnh chụp báo cáo, một bên giúp dựng tool nội bộ mà không cần thuê dev ngoài.
Qwen hỗ trợ tiếng Việt tốt đến đâu?
Qwen3.5 hỗ trợ 201 ngôn ngữ và phương ngữ, tăng từ 119 ở Qwen3, nên tiếng Việt nằm trong phạm vi huấn luyện chính thức của mô hình.
Alibaba không công bố riêng chỉ số chất lượng tiếng Việt, nên đừng tin bất kỳ bài nào khẳng định "Qwen viết tiếng Việt hay hơn ChatGPT" mà không kèm bài test. Cách duy nhất đáng tin là bạn tự chạy thử trên đúng loại nội dung mình cần.
Bộ test tối thiểu chúng tôi thường dùng khi đánh giá một mô hình mới cho công việc content:
- Viết lại một đoạn 300 từ theo brand voice có sẵn, xem mô hình có giữ được giọng không.
- Tóm tắt một file PDF hợp đồng tiếng Việt, kiểm tra xem có bịa điều khoản không.
- Trích xuất dữ liệu từ ảnh chụp bảng báo giá ra JSON.
- Viết prompt tiếng Việt có thuật ngữ chuyên ngành, xem mô hình có hiểu sai không.
Chạy bốn bài này mất khoảng 30 phút và cho bạn câu trả lời chính xác hơn mọi bảng benchmark.
Qwen Code, Qwen CLI và Model Studio khác nhau thế nào?
Qwen Code là agent lập trình chạy trong terminal, Qwen CLI là lệnh qwen của chính công cụ đó, còn Model Studio là nền tảng web và API để gọi model Qwen.
Qwen Code là dự án mã nguồn mở giấy phép Apache 2.0, được fork từ Gemini CLI rồi tùy biến lại cho dòng Qwen-Coder. Nó đọc được codebase lớn, sửa file, chạy lệnh shell, tạo commit git và hỗ trợ MCP để kéo context từ Google Drive, Jira, Figma hay Slack.
Cài bằng npm:
bash
npm install -g @qwen-code/qwen-code
Các chế độ chạy chính gồm interactive (gõ qwen trong thư mục dự án), headless cho CI/CD (qwen -p "mô tả tác vụ") và chế độ daemon phục vụ nhiều client.
Lưu ý quan trọng: gói miễn phí qua Qwen OAuth đã ngừng từ ngày 15/04/2026. Nếu file hướng dẫn nào vẫn nói "1.000 request/ngày miễn phí", đó là thông tin cũ. Hiện bạn cần API key, Coding Plan của Alibaba Cloud hoặc trỏ sang provider khác.
Model Studio là nơi bạn thử model trong playground, so sánh các bản, theo dõi chi phí và lấy API key. Cái tên "Qwen Studio" mà nhiều bài tiếng Việt hay dùng thực chất là cách gọi không chính thức của trải nghiệm Qwen trên Model Studio.
Bạn dùng Qwen bằng cách nào?
Bạn có thể dùng Qwen qua Qwen Chat trên web, gọi API trên Alibaba Cloud Model Studio hoặc tải trọng số mở về chạy trên hạ tầng riêng.
| Cách dùng |
Phù hợp với |
Cần chuẩn bị |
| Qwen Chat (web) |
Thử nghiệm, việc cá nhân, viết nội dung |
Tài khoản, không cần kỹ thuật |
| API qua Model Studio |
Sản phẩm, workflow tự động, n8n |
API key, biết gọi REST hoặc SDK |
| Tải trọng số mở |
Dữ liệu nhạy cảm, chạy on-premise |
GPU đủ mạnh, người vận hành |
| Qwen Code CLI |
Dev, tự động hóa repo, CI/CD |
Node.js, quen terminal |
Với doanh nghiệp SME Việt Nam, lối vào thực tế nhất là API qua Model Studio ghép vào n8n. Bạn không cần GPU, không cần đội DevOps mà vẫn dựng được luồng tự động: đọc email khách hàng, phân loại, sinh phản hồi nháp, đẩy vào CRM.
Các bản nhỏ như Qwen3-4B hoặc Qwen3-8B là lựa chọn hợp lý khi bạn muốn chạy nội bộ mà ngân sách hạ tầng có hạn.
Qwen phù hợp với ai và khi nào không nên dùng?
Qwen hợp với đội cần chi phí thấp, đa ngôn ngữ hoặc tự chủ hạ tầng. Không nên dùng bản hosted cho dữ liệu nhạy cảm phải lưu trú trong nước.
Nên cân nhắc Qwen khi:
- Bạn cần fine-tune mô hình trên dữ liệu riêng mà không muốn phụ thuộc vendor.
- Bạn xử lý nội dung nhiều thứ tiếng, đặc biệt có tiếng Trung.
- Chi phí token là yếu tố quyết định trong bài toán quy mô lớn.
- Bạn cần chạy on-premise vì lý do bảo mật hoặc tuân thủ.
Nên dè chừng khi:
- Dữ liệu khách hàng thuộc diện nhạy cảm và bạn dùng API hosted. Prompt gửi lên endpoint của Alibaba được xử lý theo pháp luật Trung Quốc.
- Bạn cần cam kết SLA và hỗ trợ doanh nghiệp bằng tiếng Việt.
- Giấy phép của bản bạn chọn không phải Apache 2.0. Một số bản cũ dùng Qwen License hoặc Qwen Research License chỉ cho mục đích phi thương mại, phải đọc kỹ trước khi đưa vào sản phẩm.
Qwen khác gì ChatGPT, Claude và Gemini?
Khác biệt lớn nhất của Qwen là chiến lược mở trọng số theo Apache 2.0, cho phép tải về, fine-tune và tự triển khai thay vì chỉ gọi API.
OpenAI, Anthropic và Google giữ mô hình đầu bảng ở dạng đóng. Alibaba đi ngược lại: tháng 8/2026, họ tuyên bố mở trọng số cho cả Qwen3.8-Max lẫn bản nhỏ Qwen3.8-27B, lần đầu tiên với một mô hình thuộc tầng Max.
Hệ quả thực tế cho doanh nghiệp Việt: bạn có quyền chọn giữa tiện lợi và quyền kiểm soát. Gọi API thì nhanh, tự host thì dữ liệu nằm trong nhà bạn.
Về chất lượng, đừng vội kết luận từ bảng benchmark. Các con số so sánh hiện có phần lớn do chính nhà phát hành công bố, và với tốc độ ra mẫu mới mỗi vài tháng thì mọi bảng xếp hạng đều có hạn dùng ngắn.
Câu hỏi thường gặp về Qwen
Qwen do ai phát triển?
Qwen do Alibaba Cloud, bộ phận điện toán đám mây của tập đoàn Alibaba, phát triển và giới thiệu lần đầu năm 2023 với tên tiếng Trung là Tongyi Qianwen.
Qwen có miễn phí không?
Bản trọng số mở tải về dùng miễn phí theo giấy phép Apache 2.0, nhưng bạn tự chịu chi phí hạ tầng. Bản gọi qua API trên Alibaba Cloud Model Studio tính phí theo lượng token sử dụng.
Qwen có dùng được tiếng Việt không?
Có. Qwen3.5 hỗ trợ 201 ngôn ngữ và phương ngữ, tăng từ 119 ở thế hệ Qwen3, nên tiếng Việt nằm trong phạm vi huấn luyện chính thức. Chất lượng cụ thể bạn nên tự test trên đúng loại nội dung mình cần.
Qwen Code và Qwen CLI có phải hai công cụ khác nhau không?
Không. Qwen CLI là phần giao diện dòng lệnh của Qwen Code, tức lệnh qwen mà bạn cài và chạy trên máy. Qwen Code là tên của cả dự án agent lập trình mã nguồn mở đó.
Qwen3.8-Max có gì khác Qwen3.5?
Qwen3.8-Max ra mắt ngày 3/8/2026 với 2.4 nghìn tỷ tham số và context 1 triệu token, lớn hơn nhiều so với bản mở 397 tỷ tham số của Qwen3.5 phát hành tháng 2/2026.
Doanh nghiệp Việt Nam có nên đưa Qwen vào quy trình không?
Nên thử nếu bạn cần chi phí token thấp, xử lý đa ngôn ngữ hoặc muốn tự triển khai on-premise. Nếu dữ liệu khách hàng thuộc diện nhạy cảm, hãy cân nhắc bản tự host thay vì API hosted.
Trọng số mở của Qwen dùng thương mại được không?
Phần lớn mô hình Qwen3 dense và MoE mở theo Apache 2.0, cho phép dùng thương mại. Một số bản trước đó dùng Qwen License hoặc Qwen Research License giới hạn mục đích phi thương mại, bạn cần đọc kỹ giấy phép của đúng bản mình tải.
Bắt đầu từ đâu nếu bạn muốn dùng Qwen cho công việc thật
Đọc xong bài này bạn đã biết Qwen là gì và có những nhánh nào. Việc còn lại là biến nó thành thứ chạy được trong công ty bạn.
Bước cụ thể cho tuần này: chọn một quy trình đang tốn thời gian nhất của team, chạy bốn bài test tiếng Việt ở phần trên với Qwen Chat, rồi quyết định xem có đáng đưa lên n8n hay không. Đừng dựng hệ thống trước khi biết mô hình có làm nổi việc hay không.
Nếu bạn muốn đi xa hơn phần thử nghiệm, tức tự tay dựng bot đa kênh, nối model vào n8n và deploy web app nội bộ mà không cần biết lập trình, khóa Mastering Agentic AI (OpenClaw, Vibe Coding và n8n) của Vinalink Academy đi đúng vào phần đó. Chương trình 8 buổi thực hành 100% trên laptop, kết thúc khóa bạn có bot đang chạy thật và ít nhất ba luồng n8n vận hành. Bạn xem chi tiết tại vinalink.edu.vn.