AI Trung Quốc bị chê dốt toán: Hỏi 13,8 và 13,11 số nào lớn hơn, nghe câu trả lời "chỉ muốn độn thổ"

Thứ 7, 27/07/2024 10:50
Bất chấp có những nguồn lực khổng lồ đằng sau, các mô hình AI đã được chứng minh là gặp khó khăn ngay cả với kiến thức toán học cơ bản.

Làn sóng chatbot trí tuệ nhân tạo (AI) bùng nổ ở Trung Quốc đã mang đến cho người dùng nhiều cách tạo nội dung mới - bao gồm âm thanh, viết mã, hình ảnh, mô phỏng, video và văn bản chuẩn ngữ pháp - để giải trí và hỗ trợ các công việc hàng ngày.

Nhu cầu đó đã dẫn đến sự phát triển của hơn 200 mô hình ngôn ngữ lớn (LLM), công nghệ hỗ trợ các dịch vụ AI tạo sinh (GenAI) như ChatGPT. LLM là các thuật toán AI học sâu có thể nhận dạng, tóm tắt, dịch, dự đoán và tạo nội dung bằng cách sử dụng các tập dữ liệu rất lớn.

Bất chấp những nguồn lực khổng lồ đằng sau các chatbot, các mô hình AI đã được chứng minh là gặp khó khăn ngay cả với kiến thức toán học cơ bản khi được cư dân mạng thử nghiệm với màn bình chọn trong chương trình truyền hình thực tế Singer 2024 của Trung Quốc.

AI Trung Quốc bị chê dốt toán: Hỏi 13,8 và 13,11 số nào lớn hơn, nghe câu trả lời "chỉ muốn độn thổ"- Ảnh 1.

AI "dốt toán"

Trong chương trình tuần trước, nghệ sĩ Trung Quốc Tôn Nam nhận được 13,8% phiếu bầu trực tuyến, vượt qua ca sĩ người Mỹ Chanté Moore, người nhận được 13,11% phiếu bầu. Một số cư dân mạng đã tỏ ý chế giễu bảng xếp hạng khi đùa rằng con số Moore nhận được là lớn hơn mà vẫn thua (thực tế là ám chỉ ca sĩ Mỹ hay hơn nhưng lại thua cuộc).

Một người bình luận gợi ý nên so sánh hai con số trên bằng AI. Nhưng kết quả đưa ra đã gây bất ngờ. Cả chatbot Kimi của Moonshot AI và Baixiaoying của Baichuan ban đầu đều đưa ra câu trả lời sai khi cho rằng 13,11% lớn hơn 13,8%.

Về sau, hai chatbot này đã tự sửa lỗi cũng như xin lỗi người dùng về đáp án thiếu chính xác, giải thích lỗi sai là do áp dụng cái gọi là phương pháp tiếp cận chuỗi suy nghĩ – một phương pháp lý luận trong đó ứng dụng AI được hướng dẫn từng bước qua một vấn đề.

Cùng câu hỏi tương tự, mô hình Qwen LLM của Alibaba Group Holding phải sử dụng cả Python Code Interpreter để tính toán câu trả lời, trong khi Ernie Bot của Baidu phải thực hiện sáu bước để có được câu trả lời đúng.

Ngược lại, Doubao LLM của ByteDance đã phản hồi trực tiếp bằng cách đưa ra một ví dụ minh họa: "Nếu bạn có 9,90 USD và 9,11 USD, rõ ràng 9,90 USD là nhiều tiền hơn".

Wu Yiquan, một nhà nghiên cứu khoa học máy tính tại Đại học Chiết Giang ở Hàng Châu, giải thích về việc các mô hình AI gặp sai sót về kiến thức toán: "Thạc sĩ luật thì chẳng ai giỏi toán - điều này rất phổ biến".

AI Trung Quốc bị chê dốt toán: Hỏi 13,8 và 13,11 số nào lớn hơn, nghe câu trả lời "chỉ muốn độn thổ"- Ảnh 3.

Theo Wu, GenAI không sở hữu khả năng toán học và chỉ có thể dự đoán câu trả lời dựa trên dữ liệu đào tạo. Ông cho biết một số LLM hoạt động tốt trong các bài kiểm tra toán có thể là do "nhiễm dữ liệu", nghĩa là thuật toán ghi nhớ các câu trả lời đã có sẵn trong dữ liệu đào tạo.

"Thế giới AI được mã hóa - số, từ, dấu câu và khoảng trắng đều được xử lý như nhau. Do đó, bất kỳ thay đổi nào trong câu lệnh đều có thể ảnh hưởng đáng kể đến kết quả", Wu giải thích.

Vấn đề chung của AI

Vấn đề toán học nêu trên cho thấy công nghệ AI phát triển quá nhanh nhưng chưa hoàn thiện, không chỉ ở Trung Quốc mà còn ở nhiều nơi khác trên thế giới.

Theo Zheng Ge, giáo sư luật công tại Đại học Giao thông Thượng Hải, đây là tình huống có thể khiến Trung Quốc phải gác lại nỗ lực xây dựng luật AI thống nhất toàn quốc.

Zheng cho biết: "Phần lớn các chuyên gia tin rằng thời điểm để soạn thảo luật AI thống nhất toàn quốc có thể chưa phù hợp vì công nghệ này đang phát triển quá nhanh".

"Kiểm tra so sánh số" cho các mô hình AI đã trở nên phổ biến sau khi nhà nghiên cứu Bill Yuchen Lin của Viện Allen và kỹ sư tiên tiến Riley Goodside của công ty công nghệ Scale AI nêu bật những thiếu sót cơ bản về toán học của công nghệ này trên nền tảng truyền thông xã hội X.

Khi được hỏi số nào lớn hơn, 9,9 hay 9,11, ngay cả các LLM tiên tiến như GPT-4o của OpenAI, Claude 3.5 Sonnet và Mistral AI đều trả lời là 9,11.

Trong bài đăng trên X, Goodside cho biết ông không có ý định hạ thấp chương trình LLM, nhưng muốn giúp mọi người hiểu và khắc phục những sai sót của chúng.

"Những vấn đề liên quan đến giải toán kém trong LLM hiện đã được giảm thiểu rất tốt, nhưng còn rất nhiều lỗi gây ngỡ ngàng cho người dùng", ông viết. "Chúng ta nên sẵn sàng cho việc chúng sẽ còn sai ở nhiều lĩnh vực khác nữa".

Mạnh Kiên

Cùng chuyên mục

Quà 20/10 - Để điều đáng nhớ được giữ lại

Thứ 7, 10/10/2026 17:48
Hoa thì đẹp đó, nhưng chỉ được vài hôm là héo. Món quà ở lại lâu hơn thường không phải món đắt nhất, mà là món đúng gu nhất.

Phát hiện nữ sinh SN 2008 có biểu hiện bất thường tại nhà nghỉ ở Hà Nội, sau yêu cầu chuyển 300 triệu đồng vào tài khoản “NGUYEN VAN HUNG”

Thứ 7, 10/10/2026 16:58
Công an Hà Nội kịp thời phát hiện, hỗ trợ nữ sinh SN 2008 bị các đối tượng giả danh công an đe dọa, ép chuyển 300 triệu đồng vào tài khoản mang tên “NGUYEN VAN HUNG” theo thủ đoạn “bắt cóc online”.

Hoa hậu Lê Hoàng Phương, siêu mẫu Lan Khuê khép lại “cơn mưa” Cố đô của Nguyễn Phúc Tuấn

Thứ 7, 10/10/2026 16:16
"Hôm nay, trong show diễn đầu tiên của tôi tại Việt Nam, cơn mưa lại đến như một dấu hiệu. Người Việt hay nói có nước thì có nhiều may mắn và tôi vô cùng biết ơn cơn mưa chiều nay”, NTK Nguyễn Phúc Tuấn chia sẻ.

Chuyển khoản thành công 20.920.000 đồng vào tài khoản số 206xxx ngân hàng ACB, chị Bùi Thị Hải Yến phải trình báo công an

Thứ 7, 10/10/2026 16:09
Công an phường Sơn Nam (Hưng Yên) phối hợp với Công an xã Hàm Thuận Nam (Lâm Đồng) xác minh, hỗ trợ người dân nhận lại 20,92 triệu đồng chuyển khoản nhầm.

"Ngưng ngược đãi AI": Anthropic bất ngờ cấm hành vi bạo lực, tàn nhẫn vô cớ với AI Claude

Thứ 7, 10/10/2026 16:03
Khi ranh giới giữa máy tính và con người ngày càng mờ nhạt, một quyết định vô cùng kỳ lạ nhưng mang tính bước ngoặt vừa được đưa ra: Anthropic chính thức cấm người dùng có các hành vi "bạo hành hoặc tàn nhẫn vô cớ kéo dài" đối với mô hình AI Claude.
     
Nổi bật trong ngày

3 lý do vì sao nên trồng ngay 1 bụi cây lá lốt trong nhà

Thứ 6, 09/10/2026 05:00
Trời chuyển lạnh, một bụi cây lá lốt nhỏ trong nhà không chỉ cung cấp rau cho bữa ăn mà còn có thể trở thành nguồn nguyên liệu quen thuộc để hỗ trợ chăm sóc sức khỏe.

Lời khuyên cho những gia đình rửa bát bằng miếng bọt biển

Thứ 6, 09/10/2026 06:00
Miếng bọt biển hay còn gọi là mút rửa bát là một vật dụng quen thuộc trong căn bếp của nhiều gia đình, tuy nhiên để sử dụng nó đúng cách thì không phải ai cũng biết.

Nissan Tekton - SUV cùng cỡ Creta lộ cấu hình 7 chỗ với thân dài, mâm lốp lớn hơn, dễ nâng cấp cả ADAS

Thứ 6, 09/10/2026 06:00
Nissan đang thử nghiệm SUV 7 chỗ mới, phát triển từ Tekton với thiết kế bề thế hơn, mâm 18 inch và hệ thống hỗ trợ lái ADAS dùng radar, dự kiến ra mắt năm 2027.

Honda Elevate 2026 ra mắt: Giá quy đổi từ 315 triệu đồng, thiết kế hầm hố hơn, có ghế điện, làm mát ghế, cạnh tranh Xforce, Yaris Cross

Thứ 6, 09/10/2026 06:30
Honda Elevate vừa được nâng cấp với thiết kế đầu xe hầm hố hơn, nội thất cải tiến và ghế thông gió cho cả hai hàng ghế. Mẫu SUV giữ nguyên động cơ và giá khởi điểm.

Điều tra 3 lần cho vay 500 triệu đồng, công an khởi tố Đặng Thị Phương Thảo SN 1991

Thứ 6, 09/10/2026 06:39
Trong khoảng 10 ngày, Thảo đã 03 lần cho Đ.T.T.H, vay tiền, với tổng số tiền 500.000.000 đồng.
xe.nguoiduatin.vn