Chi phí token AI trong workflow: cách tính và chặn tràn

n8n không tự hiện chi phí token AI trong workflow. Bài chỉ cách đo từng lượt chạy, ước tính chi phí tháng và đặt trần chi tiêu tự động trước khi vượt ngân sách.

Một node OpenAI trong n8n chạy xong không hiện số tiền vừa tốn. Workflow báo trạng thái thành công, log ghi lại kết quả. Riêng phần tiền model tiêu thì phải tự cộng bằng tay hoặc dựng thêm một bước tính riêng. Nhiều đội chỉ phát hiện ra chi phí đã vượt ngân sách khi hoá đơn cuối tháng của nhà cung cấp model về tới nơi.

Minh hoạ cho bài Chi phí token AI trong workflow: cách tính và chặn tràn

Chi phí token AI trong workflow tính từ đâu ra

Công thức đơn giản. Chi phí token AI trong workflow bằng tổng token đầu vào cộng token đầu ra của mỗi lần gọi model, nhân với đơn giá nhà cung cấp công bố cho từng loại token. Một node AI Agent chạy 1 lần thường gọi model nhiều lượt bên trong, không phải 1 lượt như node HTTP Request thường thấy.

Token đầu vào gồm toàn bộ nội dung gửi lên: system prompt, lịch sử hội thoại, dữ liệu người dùng, kết quả trả về từ tool trước đó nếu model dùng tool calling. Token đầu ra thì khác. Là phần model sinh ra để trả lời, thường tính giá đắt hơn đầu vào 2 tới 4 lần tuỳ model.

Token đầu vào phình lên vì đâu

Lịch sử hội thoại giữ toàn bộ câu trước đó là nguyên nhân phổ biến nhất. Workflow chatbot chạy tới lượt thứ 10 có thể gửi lại cả 9 lượt cũ trong mỗi lần gọi. Model chỉ cần vài câu gần nhất là trả lời đúng.

Token đầu ra phình lên vì đâu

Không giới hạn độ dài trả lời khiến model viết dài hơn cần thiết. Prompt yêu cầu giải thích chi tiết cho một tác vụ chỉ cần trả về có hoặc không. Cũng đẩy chi phí lên gấp nhiều lần không cần thiết.

Cách đo token thực tế mỗi lượt chạy workflow

Đo bằng cách đọc trường usage trong response của node gọi model, ghi lại vào một node riêng ngay sau đó, không đợi tới cuối workflow mới tổng hợp. Hầu hết API model đều trả kèm. Kể cả khi bạn không hỏi.

Response của OpenAI trả về object usage chứa prompt_tokens, completion_tokens và total_tokens ngay trong cùng payload. n8n đọc được các trường này bằng node Set hoặc Code ngay sau node gọi model. Không cần gọi thêm API nào khác để lấy số liệu.

Cách đoĐộ chính xácChi phí thêm
Đọc trường usage trong responseChính xác tuyệt đốiKhông tốn thêm lượt gọi
Ước tính bằng công thức 4 ký tự = 1 tokenSai lệch 10 đến 20%Không tốn gì, chỉ để dự trù trước
Gọi API đếm token riêng trước khi chạyChính xác với input, không tính outputThêm 1 lượt gọi mỗi lần chạy

Ghi số token và chi phí ước tính vào Google Sheet hoặc bảng PostgreSQL sau mỗi lần chạy. Mỗi lượt ra một dòng, cộng được theo ngày hoặc theo workflow. Không cần dựng thêm dịch vụ. Máy chủ chạy VPS n8n cài sẵn của BizMaC có PostgreSQL đi kèm, đặt bảng ghi log ngay cạnh workflow.

Cần máy chủ cài sẵn n8n để đo chi phí AI

n8n Start 490.000đ một tháng có PostgreSQL và Redis chạy sẵn, đủ để dựng bảng theo dõi token ngay bên cạnh workflow.

Xem bảng giá VPS n8n

Ước tính chi phí tháng trước khi cắm vào production

Ước tính chi phí tháng bằng cách nhân chi phí trung bình 1 lượt chạy với số lượt chạy dự kiến mỗi ngày rồi nhân 30. Chạy thử 20 tới 30 lượt với dữ liệu thật trước. Đừng ước tính từ 1 lượt chạy demo. Độ dài input thực tế thường khác demo rất nhiều.

Ví dụ một workflow phân loại email chạy 200 lượt mỗi ngày, mỗi lượt tốn trung bình 800 token đầu vào và 150 token đầu ra với model giá rẻ. Chi phí tháng rơi vào khoảng vài trăm nghìn đồng. Đổi sang model cao cấp nhất cùng hãng thì khác hẳn. Chi phí đội lên 8 tới 10 lần trong khi chất lượng phân loại chỉ nhỉnh hơn chút ít.

Bước phân loại thô nên dùng model rẻ, bước cần suy luận sâu mới gọi model đắt. Gộp chung một model mạnh cho toàn bộ workflow là sai lầm phổ biến. Chi phí đội lên mà chất lượng không tăng tương xứng.

Đặt trần chi tiêu ngay trong workflow, đừng đợi cảnh báo từ nhà cung cấp

Đặt trần chi tiêu nghĩa là workflow tự dừng gọi model khi tổng chi phí chạm ngưỡng đã định. Không phải chờ nhà cung cấp gửi email cảnh báo sau khi tiền đã tiêu. Cảnh báo từ nhà cung cấp luôn tới muộn. Sau khi khoản chi đã phát sinh.

Cách dựng ra sao. Một node Function cộng dồn chi phí đã ghi trong ngày, so với ngưỡng đặt sẵn. Vượt ngưỡng thì node IF rẽ nhánh gửi cảnh báo qua Zalo hoặc Slack và dừng workflow. Chưa vượt thì cho gọi model tiếp.

Ngưỡng nên đặt hai mức. Cảnh báo ở 70% ngân sách để còn thời gian xem lại. Chặn cứng ở 100% để workflow tự dừng, không cần người can thiệp. Chỉ đặt một mức ở 100% thì rủi ro cao. Phát hiện ra đã trễ, tiền đã tiêu hết ngân sách của cả ngày còn lại.

Hai cách cắt token đầu vào mà không đổi kết quả

Trần chi tiêu chặn lúc đã tiêu. Hai cách dưới đây khác hẳn. Cắt ngay tại gốc, giảm được 30 tới 60% token mỗi lượt chạy tuỳ workflow.

Sao chép lịch sử hội thoại ít hơn để giảm token đầu vào

Cắt lịch sử hội thoại xuống vài lượt gần nhất là cách giảm chi phí nhanh nhất cho chatbot. Lý do đơn giản. Token đầu vào chiếm phần lớn tổng chi phí trong hội thoại nhiều lượt. Giữ nguyên toàn bộ lịch sử từ đầu phiên là thói quen phổ biến nhưng ít khi cần thiết.

Giữ lại 5 tới 8 lượt gần nhất thường đủ để model hiểu ngữ cảnh cho hầu hết tác vụ hỗ trợ khách hàng. Lượt thứ 20 của một cuộc trò chuyện hiếm khi còn liên quan tới câu hỏi hiện tại. Vẫn bị gửi lại nguyên văn nếu không có bước cắt.

Cách thứ hai là tóm tắt. Tóm tắt phần lịch sử cũ thành 1 đoạn ngắn thay vì gửi nguyên văn. Tốn thêm 1 lượt gọi model, nhưng bù lại token cho các lượt sau đó trong cùng phiên. Cách này hợp với phiên chạy dài, không đáng làm cho phiên chỉ vài lượt.

Chọn model rẻ hơn cho việc không cần suy luận sâu

Chọn model rẻ hơn cho các bước phân loại, trích xuất thông tin có cấu trúc hoặc kiểm tra điều kiện đơn giản. Giữ model đắt cho bước thật sự cần lập luận nhiều bước. Nhiều nhà cung cấp có cả dòng model rẻ và model cao cấp cùng một họ, chênh lệch giá có thể tới hàng chục lần cho cùng số token.

Việc phân loại một email vào 5 nhóm cố định không cần tới model mạnh nhất thị trường. Model cỡ nhỏ trả lời đúng phần lớn trường hợp với chi phí thấp hơn đáng kể. Chỉ cần viết prompt rõ ràng và giới hạn output ở vài từ.

Cách kiểm tra model rẻ có đủ dùng ra sao. Chạy song song cả 2 model trên cùng 50 mẫu dữ liệu thật, so kết quả bằng tay. Model rẻ sai quá nhiều thì mới cần model đắt hơn. Đừng mặc định chọn model mạnh nhất ngay từ đầu vì thấy tên quen.

Tính theo token khác gì nền tảng tính theo tác vụ

Nền tảng tự động hoá tính phí theo tác vụ cộng dồn cả bước gọi API model lẫn bước không liên quan AI vào cùng một đơn giá cố định mỗi lượt chạy. n8n tự host thì tách bạch. Phí hạ tầng máy chủ trả cố định theo tháng, phí token AI trả riêng cho nhà cung cấp model theo mức dùng thật.

Workflow không gọi AI chạy bao nhiêu lượt trên n8n tự host cũng không phát sinh thêm phí ngoài tiền máy chủ. Chỉ bước nào thật sự gọi model mới cộng vào chi phí token. Khi cân nhắc triển khai AI Workflow cho doanh nghiệp, tối ưu nhắm đúng các node gọi model chứ không phải cả workflow.

Máy chạy nhiều workflow AI liên tiếp thì tài nguyên cũng là thứ phải canh. Dịch vụ quản trị máy chủ theo dõi phần đó. Hạn mức token thì khác. Vẫn do người dựng workflow tự đặt.

Câu hỏi thường gặp khi tính chi phí AI cho workflow n8n

Chi phí này có hiện sẵn trên dashboard n8n không?

Không. n8n không tự tính và hiển thị chi phí token AI trong workflow. Muốn theo dõi phải tự đọc trường usage trong response của node gọi model rồi ghi vào bảng riêng như đã nêu ở trên.

Token đầu vào và token đầu ra cái nào tốn hơn?

Token đầu ra thường tính giá cao hơn token đầu vào, phổ biến ở mức gấp 2 tới 4 lần tuỳ nhà cung cấp. Workflow trả lời dài không cần thiết vì vậy tốn kém hơn workflow gửi ngữ cảnh dài nhưng trả lời ngắn.

Đặt trần chi tiêu có làm workflow dừng đột ngột giữa chừng không?

Có, nếu chỉ đặt một ngưỡng chặn cứng. Nên đặt thêm ngưỡng cảnh báo sớm hơn, ví dụ 70% ngân sách, để có thời gian xử lý trước khi workflow thật sự bị chặn ở bước đang chạy dở.

Dùng model rẻ hơn có ảnh hưởng tới kết quả của AI Agent không?

Tuỳ tác vụ. Phân loại hoặc trích xuất dữ liệu có cấu trúc thì đổi sang model rẻ hơn gần như không đổi kết quả. Tác vụ cần suy luận nhiều bước thì nên giữ model mạnh và kiểm tra kỹ trước khi đổi.

Ghi nhanh

  • Chi phí token AI trong workflow tính bằng token đầu vào cộng token đầu ra, đọc trực tiếp từ trường usage trong response. Không cần ước tính.
  • Đo ngay sau mỗi lượt chạy, đừng đợi tổng hợp cuối tháng mới biết đã vượt ngân sách bao nhiêu.
  • Hai cách giảm nhanh nhất: cắt lịch sử hội thoại xuống 5 đến 8 lượt gần nhất, và chọn model rẻ hơn cho bước không cần suy luận sâu.
  • Đặt 2 ngưỡng: cảnh báo ở 70% ngân sách, chặn cứng ở 100%, để workflow tự dừng thay vì chờ hoá đơn cuối tháng.

Lưu ý: Bài viết chia kinh nghiệm chung, còn mỗi doanh nghiệp một quy mô và một cách vận hành. Muốn biết cách nào hợp với trường hợp của bạn — chọn gói nào, làm theo thứ tự nào, chi phí ra sao — chuyên viên BizMaC tư vấn và làm giúp bạn phần kỹ thuật.

Đọc rồi mà vẫn ngại tự làm?

Để BizMaC dựng website cho doanh nghiệp bạn

Giao diện chuẩn UX, cấu trúc chuẩn SEO, chạy mượt trên di động và dễ tự quản trị sau khi bàn giao. BizMaC làm website cho doanh nghiệp Việt từ năm 2007, đi kèm hướng dẫn vận hành chứ không bàn giao xong là hết.

Khách hàng và các chỉ số lượt theo dõi, độ phủ, doanh thu của một website doanh nghiệp