OpenAI ปรับโครงสร้างสแต็กเสียงใหม่ ยกระดับบทสนทนาแบบต่อเนื่องใน ChatGPT

Murtuza Merchant
Murtuza Merchant1 ชั่วโมงที่แล้ว
ChatGPT Voice Can Now Listen While It Speaks After OpenAI Overhauls the Audio Stack
OpenAI Reduces Voice Session Startup From Six Network Round Trips to One With New Architecture (Image: AI)

ประเด็นสำคัญ

OpenAI ปรับสถาปัตยกรรมเสียงของ ChatGPT ครั้งใหญ่ ให้เสียงไหลต่อเนื่องไม่สะดุด GPT-Live ทำให้ ChatGPT สามารถ “ฟังไปพูดไป” ได้ในเวลาเดียวกัน ลดการเชื่อมต่อไปกลับของเครือข่ายตอนเริ่มซেশনเสียงจาก 6 ครั้ง เหลือเพียง 1 ครั้ง แยกเส้นทางส่งเสียงความหน่วงต่ำออกจากงานวิเคราะห์และเรียกใช้เครื่องมือซึ่งทำงานแบบอะซิงโครนัส OpenAI เผยแพร่คำอธิบายเชิงเทคนิคแบบละเอียดของการยกเครื่องครั้งนี้

OpenAI ปรับโครงสร้างโครงสร้างพื้นฐานด้านเสียงที่อยู่เบื้องหลัง ChatGPT เปิดตัวสถาปัตยกรรมใหม่ชื่อ GPT-Live ที่ทำให้เสียงไหลต่อเนื่อง แม้ระบบจะกำลังใช้ศักยภาพการให้เหตุผลเชิงลึกหรือเรียกใช้เครื่องมือต่าง ๆ อยู่ โดยไม่ทำให้บทสนทนาถูกตัดจังหวะเหมือนเดิม

OpenAI อธิบายการเปลี่ยนแปลงครั้งนี้ผ่านชุดโพสต์ เมื่อวันที่ 3 สิงหาคม และเผยแพร่บล็อก ที่ลงรายละเอียดการออกแบบใหม่ตั้งแต่ฝั่งไคลเอนต์ไปจนถึงฝั่งโมเดล บริษัทระบุว่าสามารถลดจำนวนรอบการเชื่อมต่อเครือข่าย ตอนเริ่มต้นซیشنเสียงจากเดิม 6 รอบ เหลือเพียงรอบเดียว

กลไกการทำงานของ GPT-Live

GPT-Live กำหนด “เส้นทางด่วน” สำหรับจัดการสัญญาณเสียง แยกออกจากเส้นทางที่ใช้สำหรับให้เหตุผลเชิงลึก และเรียกใช้เครื่องมือภายนอก กระบวนการเชิงลึกเหล่านั้นรันแบบอะซิงโครนัส กล่าวคือดำเนินการอยู่เบื้องหลังโดยไม่ต้องหยุดหรือพักสตรีมเสียง

ผลลัพธ์คือซیشنเสียงที่เริ่มต้นได้เร็วขึ้น และสามารถรักษาบทสนทนาให้ต่อเนื่อง โดยไม่เกิดช่องว่างเหมือนที่ผู้ใช้เคยเจอเมื่อ ChatGPT ต้องประมวลผลคำขอที่ซับซ้อน

OpenAI ระบุในโพสต์ ว่าสถาปัตยกรรมใหม่นี้ถูกออกแบบมา เพื่อจัดการ “จุดเริ่มต้น” ของซیشنเสียงโดยเฉพาะ ทำให้บทสนทนารู้สึกเป็นธรรมชาติตั้งแต่ประโยคแรก และแก้ข้อจำกัดเชิงโครงสร้างของสแต็กเดิมที่ทำให้เลเยอร์เสียงต้องรอทุกครั้งที่มีขั้นตอนการให้เหตุผลเกิดขึ้น

อ่านเพิ่มเติม: Cosmos Hub พุ่ง 6% ท่ามกลางกระแสฟื้นตัวของวิทยานิพนธ์ Interchain

GPT-Live เจาะจงแก้ปัญหาดีเลย์เสียงของ ChatGPT

ตลอดช่วงมุ่งหน้าสู่ปี 2026 OpenAI เดินเกมเชิงรุกด้านความสามารถด้านเสียงของ ChatGPT ก่อนหน้านี้บริษัทเคยเผชิญเสียงวิจารณ์ว่า การตอบกลับด้วยเสียงของ ChatGPT ดูติดขัดและล่าช้า โดยเฉพาะเมื่อเจอโจทย์หลายขั้นตอน การยกเครื่องด้วย GPT-Live จึงสะท้อนการตอบสนองเชิงวิศวกรรมโดยตรงต่อจุดอ่อนนี้

การเปิดตัวครั้งนี้เกิดขึ้นต่อเนื่องจากการเปิดเผยของ OpenAI เมื่อเดือนก่อนว่า เวอร์ชันภายในของโมเดลหลักรุ่นถัดไป สามารถสร้างผลลัพธ์ด้านคณิตศาสตร์ใหม่ 10 รายการ ด้วยต้นทุนโทเคนราว 2,000 ดอลลาร์ สะท้อนการลงทุนโครงสร้างพื้นฐานครั้งใหญ่ทั่วทั้งสายผลิตภัณฑ์

อ่านต่อ: Qwen และ DeepSeek ดัน AI จีนจ่อประตูบ้าน Anthropic

Murtuza Merchant profile photo

Murtuza Merchant

มูร์ตูซาเป็นนักข่าวการเงินมากประสบการณ์ที่มีความเชี่ยวชาญในการรายงานข่าวเกี่ยวกับสกุลเงินดิจิทัลและเทคโนโลยีบล็อกเชน เขาเคยเขียนบทความให้กับ Benzinga และ Cointelegraph รวมถึงสื่อสิ่งพิมพ์อื่น ๆ อีกมากมาย โดยมุ่งเน้นการรายงานเกี่ยวกับเทรนด์ที่เกิดขึ้นใหม่ ภูมิทัศน์ด้านกฎระเบียบ และประเด็นอื่น ๆ ที่เกี่ยวข้อง คุณสามารถติดตามเขาได้ที่ @murtuza_merc บน Twitter และ mmerchant001 บน Telegram การเปิดเผยข้อมูล: มูร์ตูซาถือครองเหรียญ ATOM, AKT, TIA, INJ และ OSMO

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
OpenAI ปรับโครงสร้างสแต็กเสียงใหม่ ยกระดับบทสนทนาแบบต่อเนื่องใน ChatGPT | Yellow