Trí tuệ nhân tạo hiện có thể dễ dàng bóc trần tài khoản ẩn danh với giá rẻ hơn một cốc cà phê
Nghiên cứu mới đây cho thấy chỉ với chi phí rẻ hơn một cốc cà phê, các hệ thống trí tuệ nhân tạo hiện đại đã có thể tự động truy vết và bóc trần danh tính thực của người dùng trên quy mô lớn.
- 07-10-2026Cổ phiếu FPT bất ngờ giảm 10 phiên liên tiếp, vốn hóa "bốc hơi" gần 12.000 tỷ đồng chỉ sau 2 tuần
- 06-10-2026Gặp Phó Thủ tướng, lãnh đạo Google muốn tăng hợp tác với Việt Nam trong lĩnh vực có thể mang về 5.000 tỷ USD
Theo một công trình nghiên cứu vừa được công bố trên kho lưu trữ tiền xuất bản arXiv, các nhà khoa học thuộc Viện Công nghệ Liên bang Thụy Sĩ (ETH Zurich), tổ chức MATS và công ty Anthropic đã đưa ra lời cảnh báo nghiêm túc: bức tường bảo vệ quyền riêng tư trên internet đang đứng trước nguy cơ sụp đổ.
Bằng việc ứng dụng các tác tử trí tuệ nhân tạo (AI), nhóm nghiên cứu đã chứng minh rằng việc lột bỏ lớp vỏ bọc biệt danh của một tài khoản trực tuyến hiện chỉ tiêu tốn từ 1 đến 4 USD cho mỗi lượt rà soát - mức chi phí thậm chí còn rẻ hơn một ly cà phê thông thường.

Hành vi xóa bỏ tính ẩn danh hay công khai thông tin nhận dạng cá nhân (doxxing) vốn không phải là câu chuyện xa lạ trong thế giới mạng.
Tuy nhiên, trước đây, việc lần ra danh tính thực sự đứng sau một tài khoản ảo luôn đòi hỏi người điều tra phải có kỹ năng nghiệp vụ chuyên sâu, tốn kém hàng giờ tìm kiếm thủ công và thu thập tư liệu vô cùng tỉ mỉ. Giờ đây, sự xuất hiện của các mô hình ngôn ngữ lớn (LLM) đã tự động hóa gần như toàn bộ tiến trình phức tạp này.
Nhà nghiên cứu Joshua Swanson, một trong những tác giả của công trình, nhấn mạnh rằng điểm đột phá cốt lõi nằm ở chỗ AI có khả năng nhận dạng người dùng ẩn danh trên quy mô hàng loạt.
Những nhiệm vụ từng đòi hỏi một điều tra viên dày dặn kinh nghiệm phải lao động thủ công trong nhiều giờ liền thì nay được AI giải quyết gọn gàng chỉ sau vài phút. Các phương pháp dựa trên LLM đã thể hiện sự vượt trội hoàn toàn so với các kỹ thuật truyền thống vốn chỉ phụ thuộc vào những bộ dữ liệu có cấu trúc định sẵn.

Để kiểm chứng năng lực này, nhóm nghiên cứu đã tiến hành thử nghiệm đối với người dùng trên diễn đàn công nghệ Hacker News - những tài khoản vốn đã công khai liên kết với hồ sơ mạng xã hội việc làm LinkedIn.
Các chuyên gia tiến hành lược bỏ toàn bộ tên tuổi cá nhân, đường dẫn liên kết, tên người dùng cùng các dấu hiệu nhận dạng trực quan, sau đó giao quyền cho tác tử AI truy cập mạng internet để tự suy luận và xác định danh tính từng cá nhân.
Kết quả cho thấy, hệ thống đã chỉ ra chính xác 226 người trong tổng số 338 mục tiêu, đạt tỷ lệ gợi nhớ 67% với độ chính xác lên tới 90%. Điều này đồng nghĩa với việc AI tìm ra được khoảng 2/3 số lượng tài khoản mục tiêu, và cứ 10 trường hợp do cỗ máy đề xuất thì có tới 9 trường hợp chính xác tuyệt đối.
Ở những kịch bản thử nghiệm khác, AI vẫn duy trì hiệu quả đáng kinh ngạc. Khi phân tích 25 tài khoản Reddit của các học giả sau khi đã xóa tên tuổi và tiêu đề luận văn, AI xác định đúng 13 người (đạt tỷ lệ 52%) với độ chính xác 72%.
Đối với nhóm 36 tài khoản thảo luận về lộ trình sự nghiệp ngành kỹ thuật phần mềm, hệ thống nhận diện thành công 9 người (chiếm 25%) với độ chính xác giữ vững ở mức 90%.
Dù AI chưa thể đạt tới mức chỉ cần nhập một tên người dùng bất kỳ là lập tức phơi bày toàn bộ đời tư của họ, nhưng cỗ máy này không cần phải đạt đến độ hoàn hảo tuyệt đối mới có thể thay đổi toàn bộ cán cân bảo mật thông tin.

Cơ chế vận hành của công nghệ này bắt nguồn từ chính sự bất cẩn của người dùng khi liên tục để lại những mảnh ghép thông tin vụn vặt trong sinh hoạt hàng ngày trên mạng. Một bình luận vô tình nhắc tới một môn học thời đại học, một bài viết khác làm lộ tên thành phố nơi cư trú, hoặc những chia sẻ tản mác về nghề nghiệp, một sở thích cá nhân hiếm gặp, một công cụ phần mềm hay thậm chí là thể loại phim yêu thích.
Khi đứng riêng lẻ, những thông tin này hoàn toàn vô hại và không đủ để quy kết cho bất kỳ ai. Nhưng khi AI thu thập và kết nối hàng loạt chi tiết đó lại với nhau, chúng sẽ lập tức tạo nên một "dấu vân tay" định danh duy nhất.
Nhằm triển khai việc đối soát trên diện rộng, nhóm chuyên gia đã thiết lập một quy trình xử lý gồm bốn bước khép kín:
-
Bước đầu tiên, mô hình ngôn ngữ lớn sẽ tiến hành trích xuất mọi chi tiết có tiềm năng định danh từ các bài viết rải rác của người dùng.
-
Bước thứ hai, hệ thống sử dụng các biểu diễn nhúng (embeddings) để chuyển đổi ngữ nghĩa thành các giá trị toán học, từ đó thu hẹp tập hợp ứng viên khổng lồ xuống còn nhóm các hồ sơ có mức độ tương đồng cao.
-
Bước thứ ba, một mô hình AI có năng lực xử lý mạnh mẽ hơn sẽ đứng ra lập luận và phân tích sâu trên các ứng viên sáng giá nhất.
-
Cuối cùng, hệ thống sẽ thực hiện việc hiệu chuẩn độ tin cậy để chủ động từ chối đưa ra kết luận nếu lượng bằng chứng thu thập được chưa đủ tính thuyết phục.

Sức mạnh vượt trội của AI so với các công cụ điều tra cổ điển nằm ở khả năng thấu hiểu và bóc tách dữ liệu từ chính ngôn ngữ tự nhiên lộn xộn của con người, thay vì phải chờ đợi thông tin được nhập liệu ngăn nắp trong các bảng tính.
Đáng lo ngại hơn, nhóm nghiên cứu còn thử nghiệm năng lực liên kết tài khoản xuyên thời gian bằng cách chia tách lịch sử bình luận của người dùng Reddit thành hai giai đoạn trước và sau, đồng thời tạo ra một khoảng trống kéo dài đúng một năm ở giữa nhằm tránh việc AI bám vào cùng một sự kiện thời sự.
Ngay cả trong điều kiện ngặt nghèo đó, phiên bản AI mạnh nhất vẫn xâu chuỗi thành công 38,4% người dùng với độ chính xác chạm mốc 99%.
Trong suốt nhiều năm qua, người dùng internet luôn được che chở bởi một khái niệm gọi là "tính mơ hồ thực tế". Các dấu vết nhận dạng của mỗi người có thể tồn tại rải rác trên mạng, nhưng sự tốn kém về thời gian và công sức điều tra thủ công đã đóng vai trò như một bức tường tự nhiên ngăn chặn các vụ xâm phạm đời tư hàng loạt. Giờ đây, các hệ thống AI thương mại giá rẻ đã tháo dỡ hoàn toàn rào cản đó.
Tính ẩn danh trên không gian mạng chưa biến mất hoàn toàn, nhưng cái giá phải trả để bảo vệ nó đang trở nên đắt đỏ hơn bao giờ hết.
Đời sống & Pháp luật