Sau khi AI Agent lên chạy, ai đang canh chừng nó? Ba tầng bảng điều khiển: khả quan sát, đánh giá và control plane
Năm nay doanh nghiệp Việt Nam bắt đầu đẩy AI Agent lên môi trường production, rồi đụng cùng một vấn đề: có chuyện xảy ra mà không biết truy ngược thế nào. Bài này mổ xẻ ba tầng công cụ định hình năm 2026 — truy vết, đánh giá, quản trị lúc chạy, và nói rõ quy mô nào thì nên lắp tầng nào.
Chín giờ sáng, giám đốc kỹ thuật của một công ty thương mại điện tử ở TP.HCM mở Slack, thấy tin bộ phận chăm sóc khách hàng nhắn tối qua: có khách nói AI chăm sóc đã hứa hoàn toàn bộ phí ship cho họ, nhưng chính sách công ty rõ ràng chỉ bù một nửa. Anh muốn tra lại bản ghi, rồi phát hiện một chuyện rất kỳ: họ chỉ lưu câu trả lời cuối cùng của hội thoại, còn ở giữa agent đã gọi những công cụ nào, thấy dữ liệu gì, vì sao đưa ra phán đoán đó, tất cả đều không lưu.
Đây không phải vấn đề của riêng một công ty. Nửa đầu năm 2026, một loạt doanh nghiệp Việt Nam đẩy AI Agent từ POC lên môi trường chính thức, rồi đồng loạt đụng cùng một bức tường: agent biết ra quyết định rồi, nhưng không ai thấy được nó ra quyết định như thế nào.
Bối cảnh sự việc
Hai năm qua, hình thái ứng dụng AI đã thay đổi. Năm 2024 mọi người làm chatbot, gõ một câu, ra một câu, sai thì hỏi lại một lần, cái giá là người dùng gõ thêm vài chữ. Năm 2026 mọi người làm agent: nó gọi API, ghi vào database, gửi email cho khách, tiêu tiền mua dịch vụ.
Cái giá của sai lầm vì thế hoàn toàn khác. Chatbot trả lời sai là ngượng, agent làm sai là thiệt hại.
Thị trường công cụ cũng phân hóa theo. Trong một tuần tháng 8/2026 Product Hunt đã xuất hiện ba sản phẩm liên quan — Traccia làm control plane cho agent, Lenz làm API kiểm chứng sự thật độc lập, bitdrift làm khả quan sát thời gian thực trên mobile. Đây không phải trùng hợp, mà là cùng một nhu cầu nổi lên ở những góc khác nhau.
Trọng tâm lần này: ba tầng bảng điều khiển
Quan sát loạt công cụ này, có thể tổng hợp ra ba tầng. Chúng giải quyết vấn đề khác nhau, thời điểm nên lắp cũng khác nhau.
Tầng một: Truy vết (Tracing)
Ghi lại từng bước agent chạy — nhận input gì, suy luận ra sao, gọi những công cụ nào, lấy được kết quả gì, thử lại mấy lần, cuối cùng output gì.
Từ khóa của tầng này là "đầy đủ". Chỉ ghi kết quả cuối là vô dụng, vì tám phần vấn đề của agent nằm ở giữa. SDK của Traccia xây trên OpenTelemetry, chính là để dữ liệu này nối được vào hệ khả quan sát sẵn có của nhóm, chứ không phải thêm một hòn đảo cô lập nữa.
Tầng hai: Đánh giá (Evaluation)
Có một bộ dữ liệu test cố định và bộ chấm điểm, mỗi lần thay đổi thì chạy lại một lượt, ra được điểm số so sánh được.
Tầng này giải quyết chuyện "tôi sửa prompt, rốt cuộc tốt lên hay tệ đi". Nhóm không có đánh giá thì sửa prompt hoàn toàn theo cảm giác, sửa đến bản thứ năm thì đã không ai nhớ bản thứ hai thật ra tốt hơn.
Tầng ba: Quản trị lúc chạy (Runtime Governance)
Chặn ngay tại thời điểm agent hành động: cấm gọi một số dịch vụ ngoài, vượt trần chi phí thì dừng, output phải qua kiểm tra mới được thả, hành động rủi ro cao cần người duyệt.
Khác biệt của tầng này với hai tầng trước là "trước" và "sau". Truy vết và đánh giá đều là nhìn lại, còn quản trị là chặn ngay lúc đó. Agent chạm tiền, chạm dữ liệu khách hàng thì tầng này không được bỏ.
Phân tích tác động thị trường
Với người dùng Việt Nam
Người dùng thường không trực tiếp tiếp xúc những công cụ này, nhưng sẽ cảm nhận được khác biệt. AI chăm sóc khách hàng có tầng quản trị sẽ không tùy tiện hứa những thứ công ty làm không được; loại không có thì bạn sẽ thấy những vụ tranh chấp trên báo kiểu "AI chăm sóc hứa hoàn tiền rồi công ty không nhận".
Người tiêu dùng Việt Nam có thể để ý một tín hiệu: khi dịch vụ AI của doanh nghiệp mắc lỗi, nó nhanh cỡ nào để đưa cho bạn một lời giải thích cụ thể. Trả lời được "chúng tôi tra thấy hệ thống phán đoán sai ở bước nào đó" thì tức là backend có lưu bản ghi; chỉ nói được "đây là lỗi hệ thống" thì đa phần chẳng lưu gì.
Với ứng dụng doanh nghiệp
Thứ tự triển khai ba tầng này của doanh nghiệp Việt Nam, theo tôi nên như sau:
Truy vết đi trước, và làm ngay bây giờ. Tầng này chi phí thấp nhất — cách thô sơ nhất là ghi toàn bộ ngữ cảnh mỗi lần agent chạy vào một bảng dữ liệu, công cụ cũng không cần mua. Cái thật sự đắt là ngày có chuyện lại không có bản ghi.
Đánh giá thiết lập trước khi agent thứ ba lên chạy. Một hai agent còn dựa vào kiểm tra tay được, ba cái trở lên là không thể. Mà bộ dữ liệu đánh giá phải mọc ra từ các ca thất bại thật, việc này cần thời gian tích lũy, bắt đầu quá muộn là không kịp.
Quản trị triển khai khi chạm tiền hoặc chạm dữ liệu cá nhân. Nếu agent của bạn chỉ giúp sắp xếp tài liệu nội bộ thì tầng quản trị là đầu tư thừa; nếu nó gửi tin cho khách, thao tác đơn hàng, truy cập dữ liệu cá nhân thì đó là chi phí bắt buộc.
Về chi phí phải chuẩn bị tinh thần: truy vết đầy đủ sẽ sinh lượng dữ liệu đáng kể, lưu trữ và truy vấn đều tốn tiền. Thực tế đa số nhóm dùng chiến lược phân tầng — lần chạy bình thường chỉ giữ tóm tắt, lần chạy bất thường giữ toàn bộ ngữ cảnh.
Còn một chuyện doanh nghiệp Việt Nam đặc biệt phải chú ý: dữ liệu truy vết thường chứa dữ liệu cá nhân. Nội dung câu hỏi của khách, thông tin đơn hàng, cách liên hệ đều bị ghi lại đầy đủ. Thời hạn lưu giữ, khu vực lưu trữ, chiến lược khử định danh phải quy hoạch ngay khi triển khai, không phải bù sau.
Với lập trình viên
Về chọn công cụ có hai điểm phán đoán.
Thứ nhất là "có khóa vào nhà cung cấp không". Nếu hôm nay bạn dùng OpenAI, sang năm có thể đổi Anthropic hay model mã nguồn mở, thì chọn công cụ trung lập với nhà cung cấp sẽ an toàn hơn. Điểm bán của Traccia là vendor-neutral chính là chỗ này, cái giá là nó ra năm 2026, độ trưởng thành chưa bằng những kẻ đi trước như Langfuse, LangSmith.
Thứ hai là "có mã nguồn mở không". SDK mã nguồn mở nghĩa là trước khi triển khai bạn xem được nó thu những trường nào, gửi đi đâu. Điều này với các ngành có kiểm duyệt an ninh khắt khe (tài chính, y tế) thường là mấu chốt qua được hay không.
Một nhánh khác đáng chú ý là kiểm chứng output. Cách nghĩ của loại API kiểm chứng sự thật độc lập như Lenz rất thú vị — nó không để cùng một model tự kiểm tra chính mình, mà dùng model của hãng đối thủ tranh biện chéo. Điều này giải quyết điểm mù căn bản của tự kiểm tra: model không thấy được lỗi của chính nó, vì cái lỗi đó chính là nhận thức của nó.
Xu hướng phát triển tương lai
Tôi cho rằng một năm tới sẽ xảy ra ba chuyện.
Truy vết sẽ thành trang bị tiêu chuẩn, chứ không phải mua thêm. Giống như sau năm 2015 không còn ai hỏi "có nên lắp APM không", bản thân framework agent sẽ tích hợp sẵn truy vết, cạnh tranh của các hãng công cụ sẽ chuyển sang tầng phân tích và quản trị.
Đánh giá sẽ từ "chạy điểm số" chuyển sang "chạy ca thật". Hiện nhiều công cụ đánh giá có ngân hàng đề mặc định mang tính chung chung, học thuật, thực tế vô nghĩa. Thứ thật sự hữu ích là 50 ca khiếu nại của chính bạn. Công cụ sẽ đi theo hướng "giúp bạn tự động biến ca thất bại thành bộ test".
Quản trị sẽ bị pháp luật đẩy đi. Quyền thực thi của Đạo luật AI EU chính thức khởi động tháng 8/2026, quy định ở các khu vực khác cũng đang theo sau. Khi "bạn phải giải thích được vì sao AI làm vậy" trở thành yêu cầu pháp lý, control plane từ điểm cộng biến thành hạ tầng tuân thủ. Cơ quan quản lý tài chính và cơ quan chủ quản dữ liệu cá nhân của Việt Nam sớm muộn cũng sẽ có yêu cầu tương ứng, sự chuẩn bị làm bây giờ không phí.
Tổng kết và nhận định của TheAI Academy
Thái độ của tôi với chủ đề này rất thẳng: truy vết là nghĩa vụ, quản trị là lựa chọn.
Giám đốc kỹ thuật của công ty e-commerce kia về sau xử lý thế nào? Anh mất hai ngày viết một đoạn chương trình, ghi toàn bộ ngữ cảnh mỗi lần agent chạy vào PostgreSQL, gồm input người dùng, tham số và kết quả trả về của mỗi lần gọi công cụ, suy luận trung gian của model, output cuối cùng. Không mua bất kỳ công cụ nào, chi phí là hai ngày công.
Một tháng sau lại xảy ra một tranh chấp tương tự, lần này anh mười phút là tra ra căn nguyên: tài liệu chính sách mà agent đọc là bản cũ của ba tháng trước. Vấn đề được giải quyết, và anh biết thứ cần sửa là đồng bộ tài liệu, không phải model.
Đây chính là trọng tâm tôi muốn nói — bạn không cần ngay từ đầu mua gói đầy đủ nhất, nhưng bạn phải lưu dữ liệu ngay từ ngày đầu tiên. Quá nhiều nhóm trong ba tháng đánh giá công cụ chẳng lắp gì cả, rồi tháng thứ tư có chuyện mới phát hiện trong tay trống rỗng.
Nhận định: hãy lưu log lại trước, rồi mới bàn mua bộ công cụ nào. Thà bắt đầu để lại bằng chứng một cách thô ráp còn hơn hoàn hảo mà chẳng làm gì.
Lời khuyên cụ thể cho độc giả Việt Nam: nếu năm nay công ty bạn có agent sắp lên chạy, tuần này hãy làm một việc — xác nhận toàn bộ ngữ cảnh mỗi lần chạy có được lưu lại không, và bạn biết đi đâu để tra. Việc này không cần ngân sách, không cần họp, một buổi chiều là xong. Đợi đến khi cần nó mới làm thì đã muộn.
Muốn hiểu đầy đủ hơn về quy trình dựng agent, có thể xem Hướng dẫn xây dựng AI Agent; về khía cạnh an ninh của ứng dụng LLM, Checklist an ninh ứng dụng LLM có các mục kiểm tra chi tiết hơn. Muốn tìm công cụ dùng được, mục framework phát triển và hạ tầng ở trang công cụ đã sắp sẵn.
Nguồn tham khảo
Tổng hợp theo thông tin công khai, tính năng và giá sản phẩm lấy theo công bố chính thức.
Câu hỏi thường gặp
Nhóm nhỏ chỉ có một agent, có cần lắp mấy thứ này không?
Tầng truy vết thì cần, đánh giá và quản trị có thể đợi. Tối thiểu là lưu lại input, lời gọi công cụ, output của mỗi lần agent chạy, dùng database hay log đám mây đều được. Không làm việc này thì ngày có chuyện bạn chẳng có manh mối nào. Đánh giá và control plane thường chỉ đáng làm khi số agent vượt ba, hoặc bắt đầu chạm dữ liệu khách hàng.
Vì sao không thể chỉ dựa vào trang quản trị của nhà cung cấp LLM?
Trang quản trị của nhà cung cấp chỉ thấy được tầng 'gọi model', không thấy được agent của bạn trước khi gọi model đã ra quyết định gì, sau đó lại kích hoạt những công cụ nào. Tám phần vấn đề của agent nằm ở logic điều phối chứ không phải phản hồi của model, chỉ xem log model là chỉ thấy phần nổi của tảng băng.
Dữ liệu truy vết phải lưu bao lâu?
Tùy ngành của bạn. Sản phẩm SaaS thường thì 30 đến 90 ngày là đủ đáp ứng phần lớn nhu cầu gỡ lỗi; ngành tài chính, y tế bị giám sát thì phải theo yêu cầu của cơ quan chủ quản, có thể là vài năm. Lưu ý dữ liệu truy vết thường chứa dữ liệu cá nhân, thời hạn lưu giữ và chiến lược khử định danh phải quy hoạch cùng nhau, không thể giữ vô thời hạn.
Đánh giá bắt đầu thế nào để không thành hình thức?
Bắt đầu từ một ca thất bại thật. Lưu lại input thật mà agent trả lời sai tuần trước, thêm đáp án đúng, đó là dữ liệu test đầu tiên của bạn. Tích lũy 20 đến 50 ca rồi, mỗi lần sửa prompt hay đổi model thì chạy một lần. Bộ test mọc ra từ thất bại thật hữu ích hơn nhiều so với thiết kế sẵn 500 câu ngay từ đầu.