Đầu tháng 8, Anthropic thông báo mọi văn bản do Claude tạo ra sẽ mang một watermark vô hình. Internet phát điên. Có người hủy đăng ký. Có người so sánh nó với "hình xăm số trên trán". Rồi Anthropic đăng bài giải thích cơ chế — và hóa ra thứ mọi người đang sợ không phải là thứ đang thực sự xảy ra.

Không có ký tự ẩn. Không có gì được thêm vào văn bản.
Khi Claude viết, ở mỗi bước nó chọn từ tiếp theo. Với câu "Thời tiết hôm nay lạnh và…", từ tiếp theo có thể là "âm u" hoặc "xám xịt" — người đọc không quan tâm chọn từ nào. Bình thường lựa chọn này do một số ngẫu nhiên quyết định.
Watermark chỉ đổi nguồn của số ngẫu nhiên đó: thay vì ngẫu nhiên tùy ý, model dùng một khóa bí mật kết hợp vài từ đứng trước.
Anthropic ví nó như chơi cờ tỷ phú nhưng thay xúc xắc bằng các chữ số của số pi. Với người chơi, mọi nước đi vẫn ngẫu nhiên y hệt. Nhưng nếu sau đó ai đó có bảng chữ số pi, họ suy ra được ván cờ này đã dùng pi.
Kỹ thuật này là biến thể của SynthID-Text (Google DeepMind, công bố trên Nature 2024). DeepMind từng thử nghiệm bằng cách phục vụ model có watermark cho một phần lưu lượng Gemini — không có khác biệt thống kê nào về đánh giá người dùng.
Đây mới là chỗ đáng chú ý, vì nó ngược hẳn với những gì mọi người đang lo.
Nó không định danh anh. Watermark gắn với Claude, không gắn với người dùng. Không có gì trong đó truy ngược ra cá nhân, tổ chức hay đoạn chat.
Nó gần như biến mất khi Claude chỉ hiệu đính. Nếu anh viết bản thảo rồi nhờ Claude sửa ngữ pháp, hầu hết từ vẫn là của anh — watermark không có gì để bám vào.
Nó rất yếu trên nội dung nhiều sự kiện. Anthropic đưa ví dụ: "Tác phẩm nổi tiếng nhất của Newton tên là Principia…" — từ tiếp theo bắt buộc là Mathematica, không có lựa chọn thay thế, watermark không có chỗ đặt chân.
Với code thì gần như không tồn tại. Code phải chính xác tuyệt đối, sai một token là hỏng. Watermark chỉ bám được vào comment.
Nó cần văn bản dài. Đoạn ngắn có quá ít lựa chọn từ để tạo tín hiệu.
Ghép lại: chiếc CV mà mọi người đang sợ — ngắn, dày đặc tên công ty và mốc thời gian, thường được người viết rồi nhờ AI chỉnh — là gần như trường hợp tệ nhất để watermark hoạt động.
Ngược lại, thứ mang watermark mạnh nhất là bản dịch. Vì mọi từ đều do Claude chọn.
Không phải vì họ muốn. Đây là EU AI Act.
Tháng 7/2026, Anthropic cùng khoảng 190 bên ký Bộ Quy tắc EU về Minh bạch Nội dung do AI tạo ra. Từ 02/08, nhà cung cấp model frontier phải đảm bảo đầu ra AI có thể phát hiện được — không thì phạt tới 15 triệu EUR hoặc 3% doanh thu toàn cầu.
Model ra sau 02/08 phải tuân thủ ngay. Model cũ có hạn tới 02/12.
Anthropic áp dụng toàn cầu vì chưa có cách phân vùng theo khu vực một cách bền vững. Đây là hiệu ứng Brussels kinh điển: luật EU thành mặc định toàn thế giới.
Và Claude sẽ không đơn độc — các nhà phát triển lớn khác đã ký cùng bộ quy tắc và sẽ triển khai watermark riêng.
Về kỹ thuật: không có gì. Cùng chất lượng, cùng tốc độ, cùng giá.
Về xã hội: câu hỏi chuyển từ "có ai biết không?" sang "tôi có nên khai báo không?".
Với người làm việc chuyên môn, có ba điều đáng làm ngay:
Watermark chỉ bao phủ những nhà cung cấp lớn tuân thủ luật. Còn các chiến dịch thông tin sai lệch có tổ chức và lừa đảo quy mô lớn — chính là những bên có động cơ và năng lực nhất để dùng model mã nguồn mở tự host, không watermark.
Nếu công chúng bắt đầu hiểu "không có watermark = do người viết", quy định này có thể phản tác dụng đúng theo cách nó muốn ngăn chặn.
Nguồn: Anthropic — How Claude's text watermark works (14/08/2026); Nature; TechCrunch; CNN.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên!
Bạn cần đăng nhập để bình luận.