TÀI LIỆU  Thư viện kiến thức

Context Window là gì? Giới hạn ký ức AI và Claude

11:02 | 17/08/2026
Context Window là bộ nhớ làm việc tạm thời của AI, quyết định lượng thông tin mô hình có thể đọc và xử lý trong một lần tương tác. Hiểu đúng khái niệm này giúp bạn biết vì sao AI hay quên giữa chừng, chọn model phù hợp và tổ chức prompt sao cho câu trả lời không bị loãng khi hội thoại dài ra.

Context window là gì?

Context window (cửa sổ ngữ cảnh) là toàn bộ dung lượng văn bản mà một mô hình AI có thể "nhìn thấy" và tham chiếu trong một lần tạo câu trả lời, bao gồm cả chính câu trả lời đó. Đây là bộ nhớ làm việc tạm thời (working memory), hoàn toàn khác biệt với kho tri thức khổng lồ mà mô hình đã được huấn luyện.

Trong các tài liệu kỹ thuật của Anthropic, context window được định nghĩa rất rõ ràng: nó không phải là nơi lưu trữ dữ liệu vĩnh viễn, mà đóng vai trò như không gian làm việc trực tiếp của mô hình trong thời gian thực.

Cách dễ hình dung nhất: Context window giống như RAM của máy tính, còn dữ liệu huấn luyện (training data) giống như ổ cứng. RAM chỉ lưu giữ những gì bạn đang mở và thao tác. Tắt máy là mất. Ổ cứng thì luôn ở đó, nhưng bạn phải chủ động mở file lên thì RAM mới đọc được.

Hãy tưởng tượng bạn đang làm việc với một trợ lý thiên tài nhưng mắc chứng "hay quên ngắn hạn". Anh ta nhớ vanh vách mọi chi tiết bạn vừa thảo luận trong phòng họp. Nhưng vừa bước ra khỏi cửa, mọi thứ bị xóa sạch. Đó chính xác là cách context window vận hành.

Vì sao context window được đo bằng token, không phải từ?

Token là đơn vị nhỏ nhất mà mô hình dùng để xử lý văn bản, thường tương đương khoảng 3-4 ký tự tiếng Anh. Tuy nhiên, tiếng Việt có hệ thống dấu thanh và cấu trúc âm tiết phức tạp, nên khi đi qua bộ tokenizer (bộ tách từ), cùng một lượng thông tin bằng tiếng Việt thường tiêu tốn nhiều token hơn tiếng Anh (trung bình gấp 1.2 đến 1.5 lần).

Điều quan trọng cần nhớ là mọi thứ đều chia sẻ chung một "ngân sách" token. Theo tài liệu chính thức từ Anthropic, mọi thành phần trong một request đều chiếm dụng context window: system prompt, lịch sử hội thoại, kết quả từ tool, hình ảnh, tài liệu đính kèm và cả định nghĩa tool. Ngay cả phần suy luận ngầm (extended thinking) của Claude cũng được tính vào ngân sách này.

Context window khác gì với memory và training data?

Ba khái niệm này thường bị người dùng mới nhầm lẫn là một, nhưng bản chất vận hành của chúng hoàn toàn khác biệt:

Khái niệm Bản chất Vòng đời
Training data Kho tri thức tĩnh mô hình đã học Cố định theo phiên bản model
Context window Bộ nhớ làm việc trong một request Tự động xóa khi hết phiên
Memory / Projects Bộ nhớ ngoài, được nạp lại khi cần Xuyên phiên, do bạn kiểm soát

Context window hoạt động như thế nào trong một hội thoại?

Mỗi lượt trao đổi mới sẽ được cộng dồn vào context window. Toàn bộ lịch sử hội thoại cũ được giữ nguyên vẹn, cộng thêm tin nhắn mới của bạn và phần trả lời mà AI đang tạo ra.

Anthropic gọi cơ chế này là "progressive token accumulation" (tích lũy token lũy tiến). Hội thoại càng kéo dài, mỗi tin nhắn bạn gửi đi đều phải "cõng" theo sức nặng của hàng chục lượt chat trước đó.

Hệ quả thực tế là: Tin nhắn thứ 40 của bạn sẽ "đắt" hơn và chậm hơn tin nhắn thứ nhất, vì mô hình phải đọc lại toàn bộ 39 lượt trước đó để hiểu ngữ cảnh. Đây là lý do vì sao các hội thoại quá dài thường phản hồi chậm hơn và dễ bị "trôi" ý.

Khi input vượt quá giới hạn cứng, API sẽ trả về lỗi 400 (prompt too long). Tuy nhiên, trên giao diện chat (Web/App), cơ chế xử lý mềm dẻo hơn: Claude có khả năng tự động tóm tắt và nén các tin nhắn cũ khi hội thoại tiến gần đến ngưỡng giới hạn, giúp cuộc trò chuyện tiếp tục liền mạch.

Context window Claude lớn đến mức nào?

Các mô hình Claude thế hệ mới nhất hỗ trợ context window lên tới 1 triệu token trên Claude API. Các mô hình tiêu chuẩn còn lại dừng ở mức 200.000 token.

Dưới đây là thông số chi tiết được cập nhật mới nhất từ trang tài liệu Context windows của Anthropic:

Nhóm model Context window Ghi chú
Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6 1 triệu token Khả dụng trên Claude API, Amazon Bedrock, Google Cloud
Claude Sonnet 5, Sonnet 4.6 1 triệu token Mức mặc định, không cần kích hoạt beta header
Claude Fable 5, Claude Mythos 5 1 triệu token Nhóm model cao cấp nhất, chuyên trị data lớn
Claude Sonnet 4.5, Haiku 4.5 & các model khác 200.000 token Dư sức xử lý phần lớn tác vụ phân tích tài liệu

Có ba chi tiết kỹ thuật đáng lưu ý: Thứ nhất, các model 1 triệu token có thể sinh ra tối đa 128.000 token output trong một request. Thứ hai, request long-context được tính theo giá tiêu chuẩn, không bị thu phụ phí. Thứ ba, một request chứa được tối đa 600 ảnh hoặc trang PDF (giảm còn 100 với model 200k token).

Trên phiên bản Claude dành cho trình duyệt và ứng dụng di động, con số có phần linh hoạt hơn. Các gói trả phí hỗ trợ tới 1 triệu token cho model mới nhất, trong khi các model cũ hơn ở mức 500K hoặc 200K. Lưu ý rằng một phần dung lượng luôn được hệ thống dành riêng cho câu trả lời, nên độ dài hội thoại thực tế bạn nhập vào sẽ nhỏ hơn con số tối đa một chút.

Giới hạn ký ức AI đến từ đâu?

Giới hạn của AI không chỉ nằm ở dung lượng cửa sổ. Ngay cả khi cửa sổ chưa đầy, độ chính xác và khả năng ghi nhớ chi tiết vẫn có xu hướng suy giảm khi số lượng token tăng lên.

Anthropic gọi hiện tượng này là context rot (sự phân rã ngữ cảnh). Tài liệu kỹ thuật khẳng định: cửa sổ lớn giúp xử lý prompt dài, nhưng nhiều context không tự động đồng nghĩa với kết quả tốt hơn, vì khả năng recall (truy xuất) của model sẽ giảm sút khi dữ liệu quá dày đặc.

Đây là điểm rất nhiều người dùng mắc bẫy. Họ thấy "1 triệu token" liền nhồi cả kho tài liệu vào một khung chat, rồi ngạc nhiên khi AI trả lời chung chung. Nhồi 900K token vào cửa sổ 1M không khác gì đưa cho một người 1.500 trang tài liệu rồi yêu cầu tìm một chi tiết nhỏ ở trang 738. Về lý thuyết thì được, nhưng về thực tế thì không nên.

Bốn nguyên nhân cốt lõi khiến AI có vẻ như đang "đãng trí":

  • Cửa sổ tràn: Nội dung cũ bị đẩy ra ngoài để nhường chỗ cho tin nhắn mới.
  • Context rot: Thông tin vẫn nằm trong cửa sổ nhưng bị "chìm", mô hình khó truy xuất chính xác khi ngữ cảnh quá nhiễu.
  • Tóm tắt tự động: Hệ thống nén hội thoại dài, làm rơi rớt các chi tiết vi mô trong quá trình tóm tắt.
  • Đại từ mơ hồ: Bạn ra lệnh "sửa cái đó đi", nhưng mô hình không thể xác định "cái đó" là gì trong 30 lượt chat trước.

Làm sao để AI không quên ngữ cảnh giữa chừng?

Cách hiệu quả nhất là chủ động thiết kế context (context engineering) thay vì phó mặc cho mô hình tự xoay xở: phân tách nhiệm vụ, định vị thông tin quan trọng và sử dụng bộ nhớ ngoài.

Áp dụng nguyên tắc "một chat, một nhiệm vụ"

Đừng gộp việc phân tích hợp đồng, soạn email đàm phán và tính toán dòng tiền vào cùng một hội thoại. Mỗi nhiệm vụ hãy mở một chat riêng và dán lại phần context cốt lõi. Cửa sổ càng sạch, câu trả lời càng sắc bén.

Đặt thông tin quan trọng ở đầu hoặc cuối prompt

Mô hình AI thường chú ý mạnh nhất vào phần đầu và phần cuối của văn bản (hiệu ứng Primacy & Recency). Với prompt dài, hãy để tài liệu nền ở giữa, nhưng câu lệnh cốt lõi và ràng buộc quan trọng phải nằm ở đầu hoặc chốt ở cuối cùng.

Dùng XML tag để phân vùng tài liệu

Khi gửi nhiều nguồn dữ liệu cùng lúc, hãy bọc chúng trong các thẻ XML riêng biệt để mô hình không bị "rối" và nhầm lẫn giữa các nguồn:


  ...nội dung hợp đồng...



  Dựa trên điều khoản thanh toán ở thẻ document phía trên, phân tích rủi ro cho bên thuê.

Tóm tắt và mở phiên mới sau 10-15 lượt

Khi hội thoại bắt đầu nặng, hãy yêu cầu AI tạo một bản tóm tắt có cấu trúc: Mục tiêu ban đầu, Quyết định đã chốt, Ràng buộc quan trọng, Câu hỏi còn mở. Copy bản tóm tắt đó, mở một chat mới và dán vào làm tin nhắn đầu tiên.

Dùng Projects làm bộ nhớ ngoài

Với các dự án lặp lại, hãy đưa brand voice, template, và tài liệu tham chiếu vào tính năng Projects. Khung chat chỉ nên giữ phần chỉ dẫn riêng cho từng tác vụ cụ thể. Cách này giúp context window luôn gọn gàng mà AI vẫn có đủ nền tảng kiến thức.

Tránh dùng đại từ không rõ đối tượng

Thay vì viết "sửa lỗi đó đi", hãy viết rõ "sửa lỗi căn lề flexbox ở component Button đã nêu ở tin nhắn trước". Câu dài hơn vài từ nhưng sẽ tiết kiệm cho bạn hàng loạt lượt hỏi đi hỏi lại do AI hiểu sai ý.

Context window lớn hơn có luôn tốt hơn không?

Không hẳn. Context window lớn mở ra khả năng xử lý các siêu tài liệu, nhưng chất lượng đầu ra phụ thuộc vào nghệ thuật "chọn lọc" những gì đưa vào, chứ không phải "nhồi nhét" cho đầy.

Tài liệu của Anthropic nhấn mạnh: Việc chọn lọc dữ liệu nằm trong context quan trọng ngang với việc bạn có bao nhiêu chỗ trống. Đây chính là tư duy nền tảng của Context Engineering.

Trong thực tế triển khai automation tại Vinalink, chúng tôi nhận thấy một pattern rõ rệt: Người mới thường cố nhồi tối đa dữ liệu, trong khi chuyên gia luôn lọc và làm sạch dữ liệu trước khi gửi. Kết quả của nhóm chuyên gia luôn ổn định và chính xác hơn hẳn.

Vài nguyên tắc lọc dữ liệu bạn nên áp dụng ngay:

  • Chỉ gửi phần tài liệu liên quan trực tiếp tới câu hỏi, không gửi cả bộ hồ sơ.
  • Với code, hãy gửi đoạn diff (phần thay đổi) thay vì toàn bộ file 500 dòng khi bạn chỉ sửa 3 dòng.
  • Loại bỏ log, metadata, các đoạn lặp lại vô nghĩa trước khi paste vào prompt.
  • Tài liệu quá lớn nên chia chunk theo ranh giới tự nhiên (chương, mục), kèm theo một bản tóm tắt tổng thể ở đầu mỗi chunk.

Câu hỏi thường gặp về context window

Context window là gì nói ngắn gọn nhất?

Là toàn bộ lượng văn bản AI có thể "đọc" và tham chiếu để tạo ra câu trả lời trong một phiên làm việc. Nó là RAM của AI, không phải ổ cứng.

1 triệu token tương đương bao nhiêu trang tài liệu?

Tương đương khoảng 2.500 đến 3.000 trang A4 tiêu chuẩn (tùy thuộc vào ngôn ngữ và định dạng). Tuy nhiên, để ước lượng chi phí API chính xác, bạn nên sử dụng các token counting tool thay vì đếm trang thủ công.

Context window Claude hiện là bao nhiêu?

Các model cao cấp như Claude Opus 5, Sonnet 5, Fable 5 và Mythos 5 hỗ trợ 1 triệu token trên API. Các model tiêu chuẩn như Sonnet 4.5 và Haiku 4.5 có giới hạn 200.000 token.

Vì sao AI quên thông tin dù hội thoại chưa quá dài?

Thủ phạm thường là "context rot" (nhiễu ngữ cảnh). Khi dữ liệu quá dày, khả năng truy xuất chi tiết nhỏ của model bị giảm sút. Ngoài ra, việc dùng đại từ nhân xưng mơ hồ cũng khiến AI bị mất phương hướng.

Extended thinking có tính vào context window không?

Có. Mọi token suy luận (thinking tokens) đều nằm trong tham số max_tokens và được tính vào giới hạn context window cũng như chi phí của request.

Làm sao biết hội thoại sắp chạm giới hạn?

Trên API, bạn theo dõi trường usage trong response. Trên giao diện chat, dấu hiệu nhận biết là AI bắt đầu lặp lại câu hỏi cũ, bỏ qua các ràng buộc đã chốt trước đó, hoặc trả lời vòng vo, thiếu chiều sâu.

Nên dùng Projects hay dán lại context mỗi phiên?

Thông tin nền tảng lặp lại (brand voice, guideline, data mẫu) nên đưa vào Projects. Chỉ dẫn cụ thể cho từng tác vụ (task-specific instructions) nên giữ trong khung chat.

Bắt đầu từ đâu nếu bạn muốn làm chủ context

Hiểu context window mới chỉ là bước khởi đầu. Bước tiến khó hơn và mang lại giá trị cao hơn là: Biết đưa gì vào, bỏ gì ra, khi nào cần reset, khi nào dùng Project và khi nào cần thiết kế một luồng agent riêng biệt. Đó là kỹ năng chỉ có thể mài giũa qua các dự án thực chiến.

Nếu bạn muốn nắm vững hệ thống này một cách bài bản, khóa Claude AI Mastery của Vinalink Academy dành trọn buổi đầu tiên để xây dựng bộ khung Context - Prompt - Memory - Output. Từ đó, bạn sẽ tiến tới cá nhân hóa AI bằng Project, Skill và xây dựng trợ lý ảo tự động cho team Content, Marketing và Sales. Chương trình 6 buổi, thực hành 100% trên bài toán thật của doanh nghiệp.

Bạn có thể xem lộ trình chi tiết và đăng ký tại khóa học Claude AI Mastery.

Call Zalo Messenger TikTok LinkedIn