Mô hình Claude Fable 5 mới cố tình trả lời

Mô hình Claude Fable 5 mới cố tình trả lời "đần" hơn trong một số trường hợp, và đây là lý do

Thứ 4, 10/06/2026 16:00
Chi tiết này nằm ở trang 13 trong bản tài liệu kỹ thuật dài 319 trang - và nó đang là điều gây tranh cãi nhất trong ngày ra mắt Claude Fable 5.

Rạng sáng 10/6, Anthropic ra mắt Claude Fable 5 với hàng loạt kết quả benchmark ấn tượng. Nhưng thứ khiến cộng đồng AI tranh cãi gay gắt nhất lại không phải con số, không phải giá cả - mà là một đoạn văn nhỏ nằm khuất trong bản tài liệu kỹ thuật (system card) 319 trang đính kèm.

Chuyện gì đang xảy ra

Để hiểu vấn đề, cần biết Claude Fable 5 có nhiều lớp bảo vệ khác nhau. Với các chủ đề nhạy cảm như an ninh mạng hay hóa học, khi model phát hiện câu hỏi liên quan, nó sẽ chuyển sang xử lý bằng model yếu hơn (Claude Opus 4.8) và thông báo rõ ràng cho người dùng biết chuyện gì đang xảy ra. Người dùng không thích thì thôi, nhưng ít nhất họ biết.

Vấn đề nằm ở một lớp bảo vệ thứ tư, ít được nhắc đến hơn. Khi Claude Fable 5 phát hiện người dùng đang dùng nó để phát triển hoặc huấn luyện các model AI khác, model sẽ không chuyển sang Opus 4.8, không từ chối trả lời, và cũng không thông báo gì. Thay vào đó, Anthropic thừa nhận trong tài liệu kỹ thuật rằng họ sẽ can thiệp vào model bằng các kỹ thuật kỹ thuật để câu trả lời kém hiệu quả hơn - người dùng vẫn nhận được phản hồi từ Fable 5, nhưng chất lượng đã bị giảm mà họ không biết.

Tại sao Anthropic làm điều này

Để hiểu lý do, cần nhìn lại tháng 2 năm 2026. Anthropic khi đó công khai cáo buộc ba công ty AI của Trung Quốc - DeepSeek, Moonshot AI và MiniMax - tiến hành các chiến dịch có tổ chức để khai thác Claude theo quy mô công nghiệp. Theo Anthropic, các công ty này tạo ra hơn 16 triệu cuộc hội thoại từ 24.000 tài khoản giả, dù Anthropic đã chặn quyền truy cập thương mại từ Trung Quốc.

Mục đích là "distillation" (hay còn gọi là chưng cất tri thức) - một kỹ thuật trong đó một model AI nhỏ hơn học cách bắt chước model lớn hơn bằng cách hỏi hàng loạt câu hỏi có chủ đích và dùng câu trả lời làm dữ liệu huấn luyện. Hiểu đơn giản: thay vì tự nghiên cứu từ đầu, một công ty có thể "hút" tri thức từ Claude rồi nhét vào model của mình - với chi phí thấp hơn nhiều và không có bất kỳ biện pháp an toàn nào kèm theo.

Anthropic cho rằng dùng Claude để phát triển model cạnh tranh vốn đã vi phạm điều khoản sử dụng. Nhưng thực thi điều khoản bằng lệnh cấm thông thường không hiệu quả - vì người cố tình lách chỉ cần tạo tài khoản mới là xong. Cơ chế âm thầm giảm chất lượng, theo lý luận của Anthropic, sẽ triệt tiêu động cơ mà không để lộ điểm kích hoạt bảo vệ cho đối tượng xấu biết và tìm cách vượt qua.

Anthropic ước tính cơ chế này chỉ ảnh hưởng đến khoảng 0,03% lưu lượng toàn hệ thống.

Các công ty Trung Quốc được cho là đã huấn luyện các mô hình AI bằng cách chưng cất tri thức từ các mô hình hàng đầu của Claude như Opus

Tranh cãi nằm ở chỗ nào

Lập luận phản đối không phải là "Anthropic không được phép bảo vệ model của mình" - mà là "không minh bạch với người dùng trả tiền là sai về mặt nguyên tắc".

Nhà nghiên cứu AI Andrej Karpathy nhận định chất lượng model rất xuất sắc, nhưng cho rằng các biện pháp bảo vệ đang được chỉnh quá mức và cần điều chỉnh lại. Nhà phân tích Dean W. Ball cảnh báo cơ chế này có thể thu hút sự chú ý của cơ quan chống độc quyền. Một số giọng nói mạnh hơn trong cộng đồng gọi đây thẳng thắn là hành vi không trung thực với khách hàng đang trả tiền cho dịch vụ.

Vấn đề mấu chốt: làm sao người dùng biết câu trả lời họ nhận được là Fable 5 thật sự, hay là Fable 5 đã bị can thiệp? Trong các lớp bảo vệ khác, ít nhất có thông báo. Với cơ chế này, không có dấu hiệu nào để nhận ra.

Một số tiếng nói trung lập hơn cho rằng Anthropic có thể thực sự tin đây là biện pháp cần thiết cho an toàn AI, dù cách thực hiện chưa tốt. Một số khác nhận định thẳng đây đơn giản là phân khúc thị trường - Anthropic không có nghĩa vụ cung cấp năng lực AI hàng đầu cho tất cả mọi người - chứ không hẳn là vì lý do an toàn.

Người dùng Claude hiện đã có thể sử dụng mô hình Fable 5 mạnh mẽ nhất

Người dùng thông thường có bị ảnh hưởng không

Câu trả lời ngắn: hầu như không. Cơ chế này nhắm vào đối tượng rất cụ thể - các kỹ sư và nhà nghiên cứu AI đang xây dựng hệ thống huấn luyện model, thiết kế hạ tầng AI quy mô lớn, hoặc cố tình khai thác Claude để phát triển model cạnh tranh.

Với người dùng thông thường làm việc văn phòng, viết lách, lập trình ứng dụng, hay học tập - Anthropic xác nhận các biện pháp này không ảnh hưởng đến đại đa số công việc thông thường.

Vấn đề tranh cãi không phải là ai đang bị ảnh hưởng, mà là tiền lệ đang được tạo ra: một AI thương mại được thiết kế để có thể cố ý trả lời kém hơn mà người dùng không có cách nào biết.

Chi tiết tài liệu kỹ thuật của Claude Fable 5 tại đây.

Thế Duyệt

Cùng chuyên mục

Tuyển Việt Nam nhận tấm vé đặc cách tại giải châu Á

Chủ nhật, 16/08/2026 17:16
Tuyển Việt Nam sẽ góp mặt tại giải đấu cấp châu lục trong năm 2026.

Diễn biến trận đấu Malaysia vs Việt Nam: HLV Kim Sang-sik phá tan "cái dớp" kéo dài 16 năm?

Chủ nhật, 16/08/2026 16:44
Trận đấu Malaysia vs Việt Nam diễn ra lúc 20h00 ngày 16/8 thuộc khuôn khổ vòng bán kết AFF Cup 2026.

AFF Cup: Vì sao Singapore phải từ bỏ lợi thế sân cỏ nhân tạo từng gây khó cho tuyển Việt Nam, Thái Lan?

Chủ nhật, 16/08/2026 14:19
Vẫn là sân Jalan Besar, nhưng khi đó là mặt cỏ nhân tạo, tuyển Singapore từng gây ra vô vàn khó khăn cho các đội bóng mạnh tại AFF Cup.

Coi nhẹ trận thắng của tuyển Việt Nam, ngôi sao nhập tịch Indonesia bị "sếp lớn" cảnh cáo

Chủ nhật, 16/08/2026 13:10
Ngôi sao nhập tịch tuyển Indonesia đã phải nhận lời cảnh cáo.

Tuyển Malaysia nhận “trái đắng” vì nước đi của Liên đoàn, gặp bất lợi lớn khi đấu Việt Nam trên sân nhà

Chủ nhật, 16/08/2026 11:02
Quyết định của Liên đoàn bóng đá Malaysia (FAM) gây ra tranh cãi lớn, và nó đang trực tiếp ảnh hưởng đến ĐTQG nước này tại trận bán kết lượt đi AFF Cup 2026.
     
Nổi bật trong ngày

Đội bóng của HLV Park Hang-sеo thắng đậm HAGL 6-2 ở Thái Lan

Thứ 7, 15/08/2026 01:16
Kanchanaburi Power FC của HLV Park Hang-sеo tạo nên chiến thắng đậm 6-2 trước HAGL, trong trận giao hữu phục vụ quá trình chuẩn bị cho mùa giải mới.

Tự hào nghệ sĩ Việt làm văn hóa vùng miền viral: Cô dâu Khmer Phương Mỹ Chi đẹp lộng lẫy, Hoàng Thùy Linh xưng vương với chất liệu Tây Bắc

Thứ 7, 15/08/2026 01:22
Không ít lần các bản sắc văn hóa địa phương Việt Nam được các nghệ sĩ nhào nặn lộng lẫy trong các sản phẩm âm nhạc.

Một ngôi sao ĐT Việt Nam gây tranh cãi, "sếp lớn" VFF phải lên tiếng trấn an

Thứ 7, 15/08/2026 01:26
Trưởng đoàn ĐT Việt Nam Trần Anh Tú khẳng định Quang Hải vẫn nhận được sự tin tưởng lớn, bất chấp màn trình diễn chưa thật sự nổi bật ở vòng bảng AFF Cup 2026.

Better List tháng 8 có 2 hạng mục mới: Cuộc đua smartwatch cao cấp và smartphone bền bỉ chính thức bắt đầu

Thứ 7, 15/08/2026 02:27
Hai hạng mục mới của Better List tháng 8 hướng đến những nhu cầu rất thực tế: một chiếc smartphone đủ bền để đồng hành cùng người trẻ năng động và một chiếc smartwatch cao cấp có thể đáp ứng nhiều nhu cầu trong cuộc sống hằng ngày.

Tin AI tư vấn phun thuốc, nông dân Trung Quốc mất trắng 10 ha ruộng mè

Thứ 7, 15/08/2026 02:40
Sau nhiều lần nhận được câu trả lời hữu ích từ AI, người nông dân 67 tuổi dần coi công cụ này như một trợ lý canh tác và làm theo cả những hướng dẫn liên quan đến hóa chất.
xe.nguoiduatin.vn