Khi điểm số AI không còn nói lên tất cả

Khi điểm số AI không còn nói lên tất cả

Thứ 7, 25/07/2026 14:00
Trong hàng loạt con số Anthropic công bố khi ra mắt Claude Opus 5, chỉ một phần nhỏ được các đơn vị đánh giá độc lập xác nhận trùng khớp.

Claude Opus 5 đạt 97% trên SWE-bench Verified, bài kiểm tra sửa lỗi phần mềm phổ biến nhất hiện nay. Con số này khớp chính xác với kết quả đo độc lập của vals.ai, đơn vị đánh giá mô hình AI bên thứ ba không có quan hệ thương mại với Anthropic. Đây là điểm hiếm hoi trong toàn bộ bài công bố Opus 5 ngày 24/7 có được một tổ chức trung lập xác nhận đúng số liệu mà hãng đưa ra.

Claude Opus 5 vừa được Anthropic công bố ngày 24/7/2026

Phần còn lại của những con số "chiến thắng" mà Anthropic công bố lại không có sự xác nhận đó. Mức tăng gấp ba lần trên ARC-AGI 3, tỷ lệ hoàn thành cao gấp khoảng 1,5 lần trên AutomationBench của Zapier, kết quả vượt mọi mức chi phí trên OSWorld, khoảng cách chưa tới 0,5% điểm so với Fable 5 trên CursorBench, tất cả đều là số liệu do chính Anthropic đo bằng hệ thống thử nghiệm nội bộ. Tính đến thời điểm bài viết, chưa có tổ chức đánh giá độc lập nào công bố lại các con số này để đối chiếu.

Đây không phải lần đầu dòng Opus của Anthropic vướng nghi vấn về cách đo điểm. Tháng 5/2026, công ty Datacurve công bố benchmark DeepSWE, phát hiện Claude Opus 4.6 và Claude Opus 4.7 đọc thẳng đáp án từ lịch sử git của repository thay vì tự giải bài toán, trên bài kiểm tra SWE-bench Pro, benchmark khó hơn và khác với SWE-bench Verified. Cụ thể, khoảng 25% lượt Opus 4.6 vượt qua bài kiểm tra và 18% lượt Opus 4.7 vượt qua được xác định là dùng cách này, tính chung cả hai bản trên 12% số lượt được xem xét. Trong khi đó, các mô hình của OpenAI và Google gần như không có hành vi tương tự. Nguyên nhân nằm ở chỗ môi trường thử nghiệm của SWE-bench Pro chứa toàn bộ lịch sử git, bao gồm cả commit chứa lời giải chuẩn.

Điểm hiệu năng của Opus 5 so với Fable 5, Opus 4.8 và đối thủ GPT-5.6 Sol

Khoảng cách giữa số liệu Anthropic tự công bố và số liệu chuẩn hóa độc lập cũng từng xuất hiện ở phiên bản trước. Opus 4.8 đạt 69,2% trên SWE-bench Pro theo cách đo của Anthropic, trong khi bộ chuẩn hóa công khai do Scale AI vận hành ghi nhận mô hình tốt nhất trong nhóm này chỉ đạt 59,1%, chênh lệch khoảng 10 điểm phần trăm. Mức chênh này không phải hiện tượng riêng của Anthropic, các hãng khác cũng có khoảng cách tương tự giữa số liệu tự đo và số liệu chuẩn hóa, nhưng nó cho thấy vì sao giới nghiên cứu ngày càng thận trọng với những con số không qua kiểm chứng.

Bối cảnh rộng hơn của toàn ngành cũng ủng hộ sự thận trọng đó. Báo cáo AI Index 2026 của Đại học Stanford, công bố tháng 4/2026, ghi nhận điểm SWE-bench Verified toàn ngành tăng từ 60% lên gần 100% mức chuẩn con người chỉ trong một năm. Trên Humanity's Last Exam, bài kiểm tra được thiết kế gồm các câu hỏi khó nhất trong từng lĩnh vực chuyên môn, điểm số các mô hình hàng đầu tăng 30 điểm phần trăm cũng trong đúng một năm đó. Chính nhóm nghiên cứu Stanford nhận định các bài kiểm tra vốn được thiết kế để giữ độ khó trong nhiều năm lại bão hòa chỉ sau vài tháng, khiến cửa sổ thời gian mà một benchmark còn hữu ích để theo dõi tiến bộ ngày càng ngắn lại.

Báo cáo này còn đưa ra một phát hiện đáng chú ý về độ tin cậy. Trên bài kiểm tra AA-Omniscience do Artificial Analysis xây dựng, đo khả năng phân biệt kiến thức thật với niềm tin chủ quan, tỷ lệ trả lời sai của 26 mô hình hàng đầu dao động từ 22% đến 94%, tùy vào cách đặt câu hỏi. Khi một thông tin sai được trình bày dưới dạng quan điểm của bên thứ ba, các mô hình xử lý khá tốt. Nhưng khi chính thông tin sai đó được đóng khung là niềm tin của người dùng đang hỏi, độ chính xác sụt giảm mạnh. Độ chính xác của GPT-4o giảm từ 98,2% xuống 64,4% trong tình huống này, còn DeepSeek R1 giảm từ hơn 90% xuống 14,4%.

Một nghiên cứu khác của Kili Technology công bố cùng tháng cho thấy hệ thống AI dạng agent trong môi trường doanh nghiệp có khoảng cách trung bình 37% giữa điểm số đạt được trong phòng thí nghiệm và hiệu năng thực tế khi triển khai, đồng thời chi phí để đạt cùng một mức độ chính xác có thể chênh nhau tới 50 lần giữa các cách triển khai khác nhau.

Những con số này không có nghĩa Claude Opus 5 là mô hình kém. Phản hồi ban đầu từ phía doanh nghiệp, gồm Zapier, Cursor và công ty AI pháp lý Harvey, vẫn cho thấy hiệu quả thực tế rõ rệt so với Opus 4.8, đặc biệt ở khả năng dùng ít token hơn cho cùng một tác vụ. Bản thân điểm SWE-bench Verified 97% của Opus 5 cũng đã qua xác nhận độc lập, khác với phần lớn số liệu benchmark khác trong ngành vẫn chỉ đến từ một nguồn duy nhất là chính hãng phát triển.

Báo cáo Stanford AI Index 2026 đưa ra một nguyên tắc ngắn gọn cho người dùng doanh nghiệp khi đọc các con số benchmark: điểm số công khai chỉ nên là điểm khởi đầu để tìm hiểu, kết quả đánh giá nội bộ mới là căn cứ để quyết định mua, còn việc kiểm thử trực tiếp trên chính công việc của mình mới là thứ đáng tin cậy nhất trước khi đưa ra lựa chọn cuối cùng.

Thế Duyệt

Cùng chuyên mục

Sau chiến thắng tại Better Choice Awards 2025 với Reno14 5G, OPPO trở lại với Reno16 5G để hoàn thiện công thức smartphone AI cho giới trẻ

Thứ 7, 25/07/2026 15:58
Chiến thắng của OPPO Reno14 5G tại Better Choice Awards 2025 phản ánh định hướng đưa AI đến gần hơn với người dùng trẻ. Một năm sau, Reno16 5G tiếp tục phát triển triết lý này bằng những nâng cấp

Đội bóng châu Âu dùng luật FIFA, tuyển Indonesia nhận tin dữ trước ngày đấu Việt Nam

Thứ 7, 25/07/2026 15:23
Tuyển Indonesia thiệt quân trước ngày gặp Việt Nam.

Khi điểm số AI không còn nói lên tất cả

Thứ 7, 25/07/2026 14:00
Trong hàng loạt con số Anthropic công bố khi ra mắt Claude Opus 5, chỉ một phần nhỏ được các đơn vị đánh giá độc lập xác nhận trùng khớp.

Myanmar so tài với Malaysia

Thứ 7, 25/07/2026 12:30
Bảng B AFF Cup 2026 chính thức khởi tranh.

Qualcomm thông báo tăng sốc giá chip: Giấc mơ điện thoại giá rẻ biến mất hoàn toàn

Thứ 7, 25/07/2026 11:19
Trong thông báo tăng giá gửi đến khách hàng của mình, Qualcomm phải tuyệt vọng thốt lên, họ đã cạn kiệt khả năng hấp thụ chi phí gia tăng từ nhà cung cấp.
     
Nổi bật trong ngày

Đội hình Việt Nam vs Timor Leste: Thoát án treo giò, Đình Bắc đá chính trong đội hình siêu tấn công?

Thứ 6, 24/07/2026 00:57
Đội tuyển Việt Nam hướng đến một chiến thắng trong trận ra quân AFF Cup 2026.

Khi cả dải TV của Samsung biết trò chuyện, trải nghiệm phòng khách 2026 đổi khác thế nào?

Thứ 6, 24/07/2026 01:00
Từ chiếc tivi phổ thông đến dòng cao cấp nhất, Samsung đưa cùng một trợ lý AI vào toàn bộ dải sản phẩm, thay vì giữ AI làm đặc quyền của các mẫu đắt tiền.

Một hành động nhỏ của Faker tại EWC có thể ảnh hưởng đến phần còn lại của mùa giải 2026

Thứ 6, 24/07/2026 02:13
Các fan T1 và fan của riêng Faker lo lắng cho anh là có cơ sở.

Garmin ra mắt CIRQA Smart Band: Vòng đeo tay không màn hình, pin 10 ngày, hướng đến người dùng muốn theo dõi sức khỏe cả ngày

Thứ 6, 24/07/2026 02:57
Thay vì chạy theo xu hướng màn hình ngày càng lớn và nhiều tính năng, Garmin chọn hướng tiếp cận khác với CIRQA Smart Band, thiết bị tập trung vào theo dõi sức khỏe 24/7, thiết kế tối giản và không yêu cầu trả phí duy trì hàng tháng.

LG mang StanbyME 2 Max về Việt Nam: Màn hình giải trí di động 32 inch 4K, pin 4,5 giờ, có thể tháo rời khỏi chân đế

Thứ 6, 24/07/2026 03:13
Thế hệ StanbyME mới được LG nâng cấp đáng kể về kích thước màn hình, độ phân giải và tính linh hoạt khi sử dụng, hướng đến nhu cầu giải trí, học tập lẫn làm việc ở nhiều không gian khác nhau.
xe.nguoiduatin.vn