OpenAI vừa giới thiệu Ultrafast, một tầng dịch vụ preview giúp chạy GPT-5.6 Sol nhanh hơn xử lý tiêu chuẩn tới 14 lần, với tốc độ tạo tối đa 750 token đầu ra mỗi giây.
Các điểm chính:
- Ultrafast giúp GPT-5.6 Sol chạy nhanh hơn tiêu chuẩn tới 14 lần.
- Cerebras cung cấp năng lực tính toán cho chế độ này, đạt tới 750 token/giây.
- Dịch vụ đang ở giai đoạn preview giới hạn, sẽ mở rộng khi năng lực hạ tầng tăng.
Preview OpenAI Ultrafast
OpenAI thông báo ra mắt Ultrafast ngày 13/8, triển khai trước qua API cho một nhóm khách hàng chọn lọc, tập trung vào tốc độ. Công ty cho biết phạm vi tiếp cận sẽ được mở rộng theo tiến độ tăng năng lực hệ thống.
Dịch vụ sử dụng hạ tầng của Cerebras và được thiết kế để giữ nguyên năng lực của GPT-5.6 Sol, đồng thời rút ngắn đáng kể thời gian tạo phản hồi. Token đầu ra là các đơn vị văn bản được mô hình sinh ra. OpenAI cho biết trước đây, để đạt hiệu năng gần thời gian thực, người dùng thường phải chọn mô hình nhỏ hơn hoặc chuyên biệt hơn, trong khi Ultrafast hướng tới “nhiều giá trị công việc hơn trên mỗi giây xử lý”.
OpenAI kỳ vọng Ultrafast sẽ đặc biệt hữu ích cho các quy trình như ứng phó sự cố, nghiên cứu tài chính, chăm sóc khách hàng, thương mại và nghiên cứu trực tiếp. Kỹ sư có thể dùng chế độ này để rà soát log, trace và các thay đổi mã gần nhất trong lúc sự cố đang diễn ra, trong khi hệ thống hỗ trợ khách hàng có thể xử lý các yêu cầu nhiều bước trong cuộc hội thoại thời gian thực.
Xem thêm: Anthropic theo đuổi thương vụ Decart 6 tỷ USD khi chuẩn bị IPO
Tác động của GPT-5.6 Sol
Những khách hàng đầu tiên cho biết bước nhảy về tốc độ đã thay đổi cách mô hình có thể được đưa vào các quy trình tương tác. John Crepezzi của Jane Street gọi mức tăng này là “ấn tượng” và cho rằng nó giúp việc làm việc tập trung song song với mô hình trở nên thực tiễn hơn.
Courtland Lykins, phụ trách sản phẩm AI giọng nói tại Podium, nhận định Ultrafast rất giá trị cho tầng giọng nói của công ty vì “tốc độ đã hoàn toàn thay đổi trải nghiệm cuộc gọi” với các tác vụ phức tạp. OpenAI cũng cho hay các nhà nghiên cứu tài chính có thể phân tích tín hiệu thị trường và giao dịch biến động liên tục mà không phải chờ đợi các lô xử lý chậm. Trường hợp sử dụng này phụ thuộc mạnh vào dòng dữ liệu đầu vào thay đổi theo thời gian thực.
Giai đoạn preview hiện vẫn bị giới hạn bởi hạ tầng, chưa được mở rộng đại trà. OpenAI nói đang tận dụng phản hồi từ nhóm khách hàng đầu để xác định những mảng công việc nào thu được nhiều giá trị nhất từ tốc độ trước khi mở rộng quy mô cung cấp.
Mối liên kết với Cerebras có từ trước Ultrafast. Tháng 1, OpenAI công bố hợp tác với nhà sản xuất chip này nhằm bổ sung 750 megawatt năng lực tính toán AI độ trễ thấp cho nền tảng của mình. Đến tháng 2, GPT-5.3-Codex-Spark trở thành mô hình đầu tiên trong khuôn khổ hợp tác, sử dụng phần cứng Cerebras để vượt mốc 1.000 token/giây trong các tác vụ lập trình thời gian thực.
Đọc tiếp: Khối lượng giao dịch Virtuals Protocol tăng vọt 180%, phe bò nhắm mốc $0,68





