Sau khi camera học được cách hiểu khung hình: ai trả hóa đơn quyền riêng tư của AI an ninh vật lý

Dùng một câu để tìm trong cả tuần ghi hình, cắt bỏ chín phần mười báo động sai, đối chiếu biển số xuyên thành phố. Năng lực của AI an ninh vật lý nhảy vọt nhanh hơn cả pháp luật, và doanh nghiệp Việt Nam đang đứng ngay trên khoảng chênh đó.

Sau khi camera học được cách hiểu khung hình: ai trả hóa đơn quyền riêng tư của AI an ninh vật lý

Một người bạn làm đội trưởng bảo vệ ở một tòa nhà văn phòng tại Hà Nội từng nói với tôi, thứ anh sợ nhất không phải có người đột nhập, mà là bức tường giám sát mười sáu ô đó. "Nhìn chằm chằm nửa tiếng là mắt bắt đầu trôi. Có gì đó động đậy, bạn cũng không chắc là người hay là tấm biển bị gió thổi."

Nên cách làm của họ rất thực tế: tắt tiếng cảnh báo, dựa vào tuần tra.

Bước nhảy vọt của AI giám sát hình ảnh vài năm nay về bản chất là để giải bài toán này — để máy làm cái việc mà con người làm không tốt. Nhưng khi camera từ "ghi lại để tra cứu" trở thành "hiểu được và chủ động phản ứng", cả một loạt vấn đề vốn không tồn tại cũng mọc theo.

Bối cảnh sự việc

Thay đổi về mặt công nghệ đặc biệt dữ dội trong hai năm qua.

Lumana dùng mô hình hiểu hình ảnh tự phát triển VIA-1, tách chức năng thành bốn tác nhân: giám sát, ứng phó, điều tra, phân tích, tuyên bố chính thức báo động sai giảm tối đa chín phần mười, hiện triển khai hơn năm vạn camera, khách hàng gồm Meta, Salesforce và McDonald's. Coram AI chủ đạo tìm kiếm bằng ngôn ngữ tự nhiên — bạn mô tả khung hình cần tìm bằng một câu, hệ thống vài giây sau lôi đoạn video ra, thay cho cách tua nhanh ghi hình thô sơ.

Ambient.ai đi theo hướng mô hình ngôn ngữ thị giác, tuyên bố mô hình Pulsar của họ tích hợp sẵn hơn 150 đặc trưng mối đe dọa đã được kiểm chứng, và đối chiếu chéo hình ảnh với dữ liệu kiểm soát ra vào để xác thực báo động thật giả, khẳng định loại bỏ được trên 95% báo động sai. HiveWatch thì không làm bản thân hình ảnh, mà tích hợp kiểm soát ra vào, giám sát, cảm biến phân tán thành một đài chỉ huy duy nhất, con số chính thức là báo động sai giảm chín phần mười, sự kiện xử lý xong trung bình trong 22 giây.

Đáng chú ý nhất là Flock Safety. Công ty khởi nghiệp từ nhận diện biển số này đã hoàn tất vòng F trị giá 275 triệu USD do a16z dẫn dắt vào tháng 3 năm 2025, định giá 7,5 tỷ USD, đến tháng 4 năm 2026 tăng tiếp lên 8,4 tỷ USD. Nó đồng thời cũng là công ty bị các nhóm bảo vệ quyền riêng tư công kích dữ dội nhất trong lĩnh vực này.

Trọng tâm lần này

  • Từ ghi hình bị động sang chủ động hiểu, đây là bước nhảy lớn nhất của ngành an ninh trong hai mươi năm.
  • Tìm kiếm bằng ngôn ngữ tự nhiên là tính năng có khác biệt cảm nhận lớn nhất — tra cứu hình ảnh từ chỗ tua băng chuyển thành định vị bằng từ khóa.
  • Mấu chốt khiến tỷ lệ báo động sai giảm mạnh không phải mô hình mạnh hơn, mà là đưa vào xác thực chéo nhiều nguồn (hình ảnh + kiểm soát ra vào).
  • Năng lực càng mạnh, rủi ro dữ liệu cá nhân càng cao. Nhận diện khuôn mặt và tích lũy quỹ đạo phương tiện tại Việt Nam đều là vùng nhạy cảm.
  • Tranh cãi về quy mô giám sát không nằm ở một lần sử dụng, mà ở tích lũy dài hạn — đây là cốt lõi khiến Flock Safety bị chỉ trích.

Phân tích tác động thị trường

Với người dùng Việt Nam

Trước hết phải nói rõ một điều: bảng tính năng của các hệ thống này được xếp theo nhu cầu của thị trường Mỹ. Phát hiện súng, ứng phó với kẻ chủ động tấn công trong trường học, chia sẻ biển số liên cơ quan, những thứ này ở Việt Nam không phải là không dùng đến thì cũng là không được dùng.

Thứ doanh nghiệp Việt Nam thật sự nên đánh giá là mấy hạng mục khác: phân tích hành vi an toàn lao động, phòng chống thất thoát và phát hiện hành vi bất thường, hiệu quả tra cứu sau sự việc, cùng quản lý tập trung nhiều điểm. Giá trị của mấy hạng mục này tại Việt Nam hoàn toàn thành lập, và tỷ suất hoàn vốn dễ tính.

Nhưng hạng mục nhận diện khuôn mặt phải đặc biệt thận trọng. Khuôn mặt theo luật bảo vệ dữ liệu cá nhân của Việt Nam thuộc loại dữ liệu cá nhân nhạy cảm, việc thu thập cần có mục đích hợp pháp rõ ràng và làm tròn nghĩa vụ thông báo. Trong thực tế, dùng để quản lý chấm công nhân viên và dùng để phát hiện đối tượng khả nghi bên ngoài, đánh giá pháp lý hoàn toàn khác nhau; tiêu chuẩn ở nơi công cộng và ở khu vực kiểm soát cũng khác nhau. Gợi ý của tôi rất thẳng: trừ khi có tính cần thiết rất rõ ràng và đánh giá tuân thủ pháp luật đầy đủ, còn không thì giai đoạn đầu đừng bật nhận diện khuôn mặt. Giá trị của phân tích hành vi và phát hiện đối tượng đã đủ lớn, không cần vì thêm chút ít tính năng mà đạp lên lằn ranh nhạy cảm nhất.

Với ứng dụng doanh nghiệp

Từ góc mua sắm, định vị của bốn hãng này thực ra khác nhau, trộn chung mà so là so sai.

Lumana, Coram AI, Ambient.ai là các đối thủ ở phía hình ảnh, xử lý "camera nhìn thấy gì". Khác biệt giữa ba hãng là: tìm kiếm bằng ngôn ngữ tự nhiên của Coram trực quan nhất, Ambient nhấn mạnh suy luận nhân quả phù hợp cho bối cảnh giám định, Lumana chủ đạo bốn tác nhân phân công và tương thích camera sẵn có.

HiveWatch thì hoàn toàn là một tầng khác — nó xử lý "sau khi báo động vào thì ai đi làm gì". Nếu vấn đề của bạn là nhiều hệ thống mỗi cái tự nhảy báo động, người trực không phân biệt được thứ tự ưu tiên, thì cái bạn cần là HiveWatch chứ không phải mua thêm một bộ AI hình ảnh.

Còn một chi phí thường bị bỏ qua: các hệ thống này tạo ra lượng lớn sự kiện, mà mỗi sự kiện về lý thuyết đều nên có hồ sơ xử lý. Trước khi triển khai phải nghĩ cho rõ, đội bảo vệ của bạn có đủ nhân lực để tiếp nhận các phiếu công việc này không. Hệ thống giảm báo động sai từ bốn trăm lượt một ngày xuống bốn mươi lượt, bốn mươi lượt đó vẫn phải có người xử lý.

Với lập trình viên

Cơ hội của đội ngũ trong nước nằm ở bối cảnh chuyên biệt và tuân thủ pháp luật.

Trong dữ liệu huấn luyện mô hình của các hãng quốc tế không có vỉa hè có mái che của Việt Nam, không có sự lộn xộn của việc đậu xe máy, không có mật độ dòng người của chợ đêm và chợ truyền thống. Mô hình phát hiện cho các bối cảnh này là việc tỉ mỉ mà các hãng ngoại sẽ không đầu tư.

Mảng tuân thủ pháp luật còn nhiều cơ hội hơn. Khi doanh nghiệp Việt Nam đưa loại hệ thống này vào, thứ cần nhất thực ra là một cơ chế chứng minh được "chúng tôi có làm tốt việc bảo vệ dữ liệu cá nhân": tự động kiểm soát thời hạn lưu dữ liệu, hồ sơ truy cập kiểm toán được, tự động khử nhận dạng với hình ảnh nhất định. Những tính năng này trong sản phẩm quốc tế thường là tính năng phụ, nhưng ở Việt Nam có thể là mấu chốt để qua được hay không.

Xu hướng phát triển tương lai

Xu hướng đầu tiên là mô hình ngôn ngữ thị giác sẽ trở thành trang bị tiêu chuẩn. Phân tích theo quy tắc truyền thống gặp tình huống chưa được định nghĩa là mất tác dụng, còn mô hình ngôn ngữ thị giác hiểu được ngữ nghĩa khung hình và bối cảnh trước sau. Cái giá là nhu cầu tính toán cao, nên phần cứng điện toán biên sẽ được nâng cấp theo — đây cũng là lý do gần như hãng nào cũng đẩy máy chủ biên riêng.

Xu hướng thứ hai là hợp nhất nhiều nguồn. Chỉ dựa vào hình ảnh rất khó phán đoán một người có nên xuất hiện ở đó hay không, đối chiếu thêm quẹt thẻ ra vào, cảm biến, thậm chí dữ liệu xếp ca vào thì mới ép được tỷ lệ báo động sai xuống. Điều này nghĩa là hệ thống an ninh sẽ ngày càng giống một nền tảng tích hợp dữ liệu, chứ không phải một bộ phần mềm camera.

Xu hướng thứ ba, cũng là điều tôi cho là quan trọng nhất, là quy định pháp luật sẽ đuổi kịp. Đạo luật AI của EU đã xếp nhận dạng sinh trắc học từ xa theo thời gian thực vào loại ứng dụng rủi ro cao bị cấm về nguyên tắc, quyền thực thi chính thức khởi động ngày 2 tháng 8 năm 2026. Việt Nam hiện chưa có luật chuyên biệt, nhưng khung pháp lý sẵn có về bảo vệ dữ liệu cá nhân cùng các văn bản giải thích của cơ quan quản lý, sớm muộn cũng sẽ đưa ra lằn ranh rõ ràng hơn cho loại ứng dụng này. Hệ thống đưa vào lúc này, khi thiết kế tốt nhất nên chừa không gian điều chỉnh.

Tổng kết và bình luận của TheAI Academy

Quan sát của tôi về lĩnh vực này là: năng lực chạy nhanh hơn quy định, và doanh nghiệp đang đứng ngay trên khoảng chênh đó.

Về mặt công nghệ chẳng có gì phải nghi ngờ, tìm kiếm bằng ngôn ngữ tự nhiên, báo động sai giảm mạnh, tích hợp xuyên hệ thống, những thứ này đều là tiến bộ thực chất, và thật sự đang giải quyết điểm nghẽn thật của ngành bảo vệ. Bức tường giám sát bị tắt tiếng cảnh báo của bạn tôi chính là lý do tồn tại của ngành này.

Nhưng mức định giá 8,4 tỷ USD của Flock Safety, cùng với sự công kích dữ dội mà nó đồng thời gánh chịu, nói lên một chuyện khác: cái giá của con đường này là có thật. Cốt lõi tranh cãi chưa bao giờ là một lần sử dụng có chính đáng hay không, mà là quỹ đạo di chuyển tích lũy dài hạn, số lượng lớn, xuyên cơ quan, rốt cuộc sẽ cấu thành cái gì. Câu hỏi này không có đáp án đơn giản, nhưng giả vờ nó không tồn tại thì chắc chắn là sai.

Bình luận: AI an ninh vật lý đã hữu dụng đến mức không lắp thì tiếc, nhưng nó cũng là chỗ doanh nghiệp dễ đạp phải lằn ranh dữ liệu cá nhân nhất. Công nghệ thì nên mua, đánh giá tuân thủ pháp luật thì đừng tiết kiệm — khoản tiền đó rẻ hơn phí phần mềm, rẻ hơn tiền phạt rất nhiều.

Gợi ý cụ thể cho độc giả Việt Nam: nếu bạn phụ trách an ninh doanh nghiệp, giai đoạn đầu hãy tập trung vào các tính năng không liên quan đến nhận dạng sinh trắc học — phân tích hành vi, phát hiện đối tượng, tìm kiếm sau sự việc, giá trị của ba hạng mục này đã rất lớn mà rủi ro pháp lý thấp. Hai, trước khi triển khai nhất định phải cùng bộ phận pháp chế xác nhận mục đích thu thập, cách thông báo và thời hạn lưu trữ, và ghi ba điều này vào cấu hình hệ thống chứ không chỉ ghi vào tài liệu chính sách. Ba, nếu điểm nghẽn của bạn là "báo động quá nhiều không ai xử lý", thì cái cần tìm là nền tảng tích hợp chứ không phải mua thêm một bộ hệ thống phát hiện. Muốn tìm hiểu sâu hơn về công cụ liên quan, có thể tham khảo mục AI quyền riêng tư và an ninh trên trang, hoặc xem các đề tài rà soát tuân thủ trong Mẫu prompt AI.

Nguồn tham khảo

(Bài viết được tổng hợp theo thông tin công khai, lấy theo công bố chính thức; các phán đoán liên quan đến tuân thủ luật bảo vệ dữ liệu cá nhân xin tham vấn ý kiến pháp lý chuyên môn.)

Câu hỏi thường gặp

Doanh nghiệp Việt Nam có thể dùng nhận diện khuôn mặt để kiểm soát ra vào không?

Khuôn mặt theo luật bảo vệ dữ liệu cá nhân của Việt Nam thuộc loại dữ liệu cá nhân có độ nhạy cảm cao, việc thu thập cần có mục đích hợp pháp cụ thể và làm tròn nghĩa vụ thông báo. Dùng để chấm công nhân viên và dùng để phát hiện đối tượng khả nghi bên ngoài có đánh giá pháp lý khác nhau; tiêu chuẩn ở khu vực kiểm soát và nơi công cộng cũng khác nhau. Nên hoàn tất đánh giá tuân thủ pháp luật trước khi triển khai, giai đoạn đầu có thể tạm chưa bật tính năng nhận diện khuôn mặt.

Lumana, Coram AI và HiveWatch nên chọn thế nào?

Hai cái đầu là đối thủ về hiểu hình ảnh, xử lý camera nhìn thấy gì; HiveWatch xử lý việc phân luồng và điều phối chỉ huy sau khi báo động vào. Nếu điểm nghẽn là tra cứu hình ảnh quá chậm, chọn tìm kiếm bằng ngôn ngữ tự nhiên của Coram AI; nếu là nhiều hệ thống báo động lộn xộn không ai phân biệt được thứ tự ưu tiên, thì cái cần là HiveWatch.

Cách nói báo động sai giảm chín phần mười có đáng tin không?

Loại con số này thường là so với phát hiện dịch chuyển theo quy tắc truyền thống, và đo trong điều kiện bối cảnh nhất định. Hiệu quả thực tế thay đổi rất nhiều theo ánh sáng, góc camera và mật độ dòng người. Nên chọn vài camera dễ báo sai nhất của mình để làm POC đo thực tế, đừng chỉ nhìn con số trên slide.

Đạo luật AI của EU có ảnh hưởng đến doanh nghiệp Việt Nam không?

Nếu sản phẩm hoặc dịch vụ của bạn bán sang thị trường EU thì sẽ bị ảnh hưởng — đạo luật này có giới hạn nghiêm ngặt với các ứng dụng như nhận dạng sinh trắc học từ xa theo thời gian thực, quyền thực thi khởi động từ ngày 2 tháng 8 năm 2026, vi phạm quy định cấm có thể bị phạt tối đa 35 triệu euro hoặc 7% doanh thu năm toàn cầu. Doanh nghiệp chỉ bán trong nước tuy không bị áp dụng trực tiếp, nhưng hướng quy phạm của nó thường trở thành căn cứ tham khảo cho nhiều nước.

繁體中文版 →