Anthropic เปิดตัว Claude Sonnet 5.5 เมื่อวันจันทร์ โดยระบุว่าโมเดล AI ระดับกลางรุ่นใหม่นี้ทำงานได้เร็วขึ้นกว่าเดิมมากกว่า 30% และช่วยลดต้นทุนต่อหนึ่งงาน (per‑task) ได้สูงสุดราว 30% เมื่อเทียบกับรุ่นก่อนหน้า
ประเด็นสำคัญ:
- Sonnet 5.5 ทำคะแนนทดสอบโค้ด Terminal-Bench 4.0 ได้ 70.6% เทียบกับเพียง 10.3% ในรุ่น Sonnet 5
- เป็นโมเดลตระกูล Sonnet รุ่นแรกที่มาพร้อมเกราะป้องกันไซเบอร์ระดับเดียวกับที่เคยใช้เฉพาะระบบเรือธงของ Anthropic
- มีผลทดสอบอิสระชุดหนึ่งพบว่า ต้นทุนต่อหนึ่งงานอาจสูงกว่า Sonnet 5 เมื่อใช้งานในระดับโหลดสูงสุด
ผลทดสอบและสมรรถนะของ Claude Sonnet 5.5
Sonnet 5.5 เป็นโมเดลลำดับที่สองในตระกูล Claude 5.5 เปิดตัวห่างจากรุ่นเรือธง Claude Opus 5.5 เพียงหกวัน ตามคำประกาศของบริษัทในเอกสารเปิดตัวบนเว็บไซต์ Anthropic
Anthropic วางตำแหน่ง Sonnet 5.5 ให้เป็นคู่หูที่ทำงานเร็วและคุ้มค่ากว่า Opus 5.5 เหมาะกับงานที่กรอบชัด เช่น งานประจำในองค์กร การแก้บั๊ก และการจัดทำเอกสาร สไลด์ และสเปรดชีตเวอร์ชันขัดเกลาแล้ว โดยตั้งราคาที่ 2 ดอลลาร์ต่อโทเคนขาเข้า 1 ล้านโทเคน และ 10 ดอลลาร์ต่อโทเคนขาออก 1 ล้านโทเคน
ในการทดสอบ Terminal-Bench 4.0 ซึ่งเป็นแบบทดสอบด้านการเขียนโค้ดเชิงเอเจนต์ Sonnet 5.5 ทำคะแนนได้ 70.6% เทียบกับ 10.3% ใน Sonnet 5 และ 66.4% ใน Opus 5.5 ที่มีราคาสูงกว่า นอกจากนี้ยังกลายเป็น โมเดล Sonnet รุ่นแรกที่สามารถเล่นเกม Pokémon Red จบได้จากเพียงภาพหน้าจอ ซึ่งถือเป็นการทดสอบความสามารถด้านงานระยะยาวและการเข้าใจภาพ
ปัจจุบัน Sonnet 5.5 ให้บริการ บนทุกแพลตฟอร์มของ Anthropic รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure ขณะเดียวกัน Anthropic ระบุว่า Claude Haiku 5.5 ซึ่งเป็นโมเดลขนาดเล็กกว่า เจาะกลุ่มงานปริมาณมากและอ่อนไหวต่อราคา จะตามออกมาในอีกไม่กี่สัปดาห์ข้างหน้า เพื่อปิดไลน์อัปให้ครบสามรุ่น
อ่านเพิ่มเติม: OpenAI ชะลอโครงการ Frontier AI หลังเหตุ “หนีออกจาก Sandbox” เมื่อ 20 ก.ย.
เกราะป้องกันไซเบอร์และต้นทุนของ Sonnet 5.5
Anthropic อ้างอิงคำให้สัมภาษณ์ของ Daniel Vogel ประธานเจ้าหน้าที่ปฏิบัติการของ Epic Games ซึ่งระบุว่า Sonnet 5.5 สามารถจัดการโค้ดระบบเกมเพลย์จำนวนหลายหมื่นบรรทัดได้ในการทดสอบช่วงต้น โดย Vogel ระบุว่าโมเดลใหม่นี้ “ผ่านมาตรฐานคุณภาพระดับเดียวกับที่คาดหวังจากโมเดลระดับท็อป”
ด้วยสมรรถนะด้านไซเบอร์ที่ใกล้เคียง Opus 5 ทำให้ Sonnet 5.5 เป็นโมเดลตระกูล Sonnet รุ่นแรกที่เปิดตัวมาพร้อมมาตรการป้องกันด้านความปลอดภัยไซเบอร์ ซึ่งก่อนหน้านี้ Anthropic สงวนไว้ให้เฉพาะโมเดลที่มีความสามารถสูงสุด งานแก้บั๊กทั่วไปยังคงทำได้ตามปกติ แต่คำขอที่มีความเสี่ยงด้านไซเบอร์ระดับสูง ระบบจะแสดงให้เห็นชัดเจนว่าถูกลดระดับกลับไปใช้ Sonnet 5 นอกจากนี้ยังมีตัวจัดประเภท (classifier) ชุดใหม่ เพื่อบล็อกความพยายามดึงกระบวนการให้เหตุผลภายในของโมเดลออกมา
อย่างไรก็ตาม ไม่ใช่ทุกการทดสอบที่สนับสนุนข้ออ้างเรื่องต้นทุนที่ถูกลง รายงานจาก Artificial Analysis ระบุว่า ในการทดสอบแบบถ่วงน้ำหนักต้นทุนต่อหนึ่งงานที่โหลดสูงสุด Sonnet 5.5 มีต้นทุนอยู่ที่ 7.60 ดอลลาร์ ต่อหนึ่งเบนช์มาร์ก เทียบกับ 5.09 ดอลลาร์ของ Sonnet 5 แม้ว่าโมเดลใหม่จะทำคะแนนดัชนีรวมเพิ่มจาก 38 เป็น 56 ก็ตาม
การเปิดตัว Sonnet 5.5 เกิดขึ้นหลัง Anthropic เปิดตัว Opus 5.5 เมื่อวันที่ 22 ก.ย. พร้อมปรับลด ราคาโมเดลเรือธงลง 20% เหลือ 4 ดอลลาร์ต่อโทเคนขาเข้า 1 ล้านโทเคน และ 20 ดอลลาร์ต่อโทเคนขาออก 1 ล้านโทเคน โดยบริษัทระบุในครั้งนั้นว่า Opus 5.5 จะมีต้นทุนต่ำกว่า Opus 5 ราว 40% สำหรับการใช้งานทั่วไป และสร้างผลลัพธ์ได้เร็วขึ้นกว่า 30% ขณะเดียวกัน OpenAI ก็เปิดตัว GPT-6 Sol และ GPT-6 Luna ในวันเดียวกัน โดยตั้งราคาครึ่งหนึ่งของรุ่นก่อนหน้า
เรื่องถัดไปที่ควรอ่าน: BlackRock มองพลังประมวลผลเดินหน้าสู่ตลาดฟิวเจอร์ส

