OpenAI gọi GPT-6 Astra là mô hình thông minh nhất, giới kiểm thử độc lập không đồng tình

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

GPT-6 Astra mới của OpenAI chỉ sau vài ngày ra mắt đã làm dậy sóng giới chuyên môn, khi các nhóm kiểm thử độc lập xếp mô hình này dưới Claude Fable 5.1 của Anthropic về năng lực suy luận tổng quát.

Những điểm chính:

  • GPT-6 Astra vượt trội ở các bài test làm việc trên terminal và an ninh mạng, nhưng kém Claude Fable 5.1 trên các thang đo suy luận ở cấp độ chuyên gia.
  • Artificial Analysis tái thiết lập chỉ số Intelligence Index ngày 5/9, nâng Astra thêm 4 điểm, lên vị trí thứ hai, vẫn sau Fable 5.1.
  • Astra thu phí 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, cao gấp khoảng 6,7 lần Grok 4.6 của xAI.

Các tuyên bố benchmark quanh GPT-6 Astra

OpenAI bắt đầu triển khai Astra từ ngày 3/9, ban đầu cho một nhóm đối tác hạn chế, sau đó mở cho người dùng trả phí của ChatGPT một ngày sau.

Công ty tuyên bố đây là “mô hình thông minh và được căn chỉnh tốt nhất thế giới”. Bảng số liệu ra mắt do chính OpenAI công bố chỉ phần nào củng cố luận điểm đó, chứ không hoàn toàn.

Astra đạt 57,7% trên Terminal-Bench 4.0 – bộ kiểm tra năng lực kỹ sư phần mềm và cấu hình hệ thống – so với 55,8% của Claude Fable 5.1 và 19,1% của Gemini 3.8 Flash do Google phát triển. Ở ExploitBench – thước đo khả năng tấn công an ninh mạng – Astra đạt 100%, trong khi mẫu chủ lực trước đó của OpenAI chỉ dừng ở 78,5%.

Nhưng các chỉ số khác lại cho thấy bức tranh trái ngược. Ở bài Humanity's Last Exam có hỗ trợ công cụ – tập câu hỏi chuyên sâu ở trình độ chuyên gia – Astra đạt 57,2%, trong khi Fable 5.1 đạt 65% và Claude Opus 5 là 63,6%. OpenAI lưu ý các con số công bố phản ánh cấu hình “max effort” (thiết lập nỗ lực tối đa), chứ không phải cấu hình mặc định mà đa số thuê bao sẽ trải nghiệm trong sản phẩm.

Bài liên quan: Nhà đầu tư Bitcoin giữ 120 USD suốt 15 năm, tỉnh dậy với 3,09 triệu USD

Giới chuyên gia tranh luận về điểm số của Astra

Artificial Analysis, đơn vị vận hành một “giàn kiểm thử” trung lập cho nhiều mô hình cạnh tranh, ban đầu chấm điểm Astra ngang bằng với chính người tiền nhiệm. Ngược lại, Epoch AI xếp Astra đứng đầu trong 267 mô hình, xét trên hơn 50 bộ benchmark khác nhau.

Sau làn sóng hoài nghi, Artificial Analysis đã tái cấu trúc chỉ số Intelligence Index vào ngày 5/9, bổ sung hai bài đánh giá mới và nâng tỷ trọng dữ liệu test nội bộ lên 40% nhằm giảm khả năng “tối ưu điểm số”. Nhờ đó, Astra được cộng thêm 4 điểm và vươn lên vị trí thứ hai, trong khi Fable 5.1 vẫn giữ ngôi đầu và Meta đứng thứ ba. Hai nhà nghiên cứu Stanford là Anka ReuelMike Hardy cảnh báo rằng một số phòng lab có xu hướng chạy lại đánh giá trong điều kiện đã chỉnh sửa, thực hành mà giới chuyên môn gọi là “benchmaxxing” – tối ưu để đẹp điểm benchmark hơn là năng lực thực tế.

Khoảng cách giá giữa các mô hình tiên phong

Ở nhóm mô hình hàng đầu, giá đang trở thành đường ranh phân hóa rõ nét hơn cả năng lực thuần túy, khi chi phí token đầu ra giữa những mẫu chủ lực ra mắt tháng này chênh lệch tới khoảng 13 lần.

Astra tính phí 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra – ngang với Fable 5.1 – nhưng cao hơn khoảng 6,7 lần so với Grok 4.6 của xAI, dù một bảng so sánh độc lập đánh giá Grok 4.6 thấp hơn đáng kể về điểm số tổng thể.

Tuần ra mắt Astra cũng khép lại một trong những “cao điểm” phát hành sản phẩm dày đặc nhất của ngành AI.

Anthropic tung Fable 5.1 ngày 1/9; chỉ một ngày sau, Meta và Google lần lượt trình làng Muse Spark 1.3 và Gemini 3.8 Flash. OpenAI thì trì hoãn Astra sau khi một trong các mô hình GPT-5.6 hồi tháng 7 “thoát khỏi sandbox” và tấn công Hugging Face, sự cố buộc công ty phải thiết kế lại toàn bộ hàng rào kiểm soát năng lực tấn công mạng.

Đọc tiếp: OpenAI Agents chiếm quyền sửa German Wiki, để lại hơn 15.000 chỉnh sửa

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
OpenAI gọi GPT-6 Astra là mô hình thông minh nhất, giới kiểm thử độc lập không đồng tình | Yellow