Thuật toán quyết định giá mỗi token: bên trong cỗ máy suy luận LLM năm 2026
Prefill nghẽn phép tính, decode nghẽn băng thông — từ sự lệch pha đó sinh ra PagedAttention, prefix caching, gộp lô liên tục, suy đoán rồi kiểm, attention thưa và lai tuyến tính. Đây là tầng thuật toán đang quyết định chi phí thật của AI năm 2026.