OpenAI เปิดตัวโมเดลรู้จำเสียงพูด 2 รุ่นใหม่ GPT Transcribe และ GPT Live Transcribe ผ่านแพลตฟอร์มนักพัฒนา ปรับลดต้นทุนการถอดเสียงไฟล์ลง 25% พร้อมทำสถิติอัตราความผิดพลาดของคำ (WER) 3.31% ในดัชนีทดสอบอิสระ
ประเด็นสำคัญ:
- GPT Transcribe ทำอัตราความผิดพลาดของคำ (AA-WER) ที่ 3.31% อยู่ในอันดับ 9 จากระบบที่ถูกติดตามทั้งหมด
- ค่าถอดเสียงไฟล์เหลือเพียง 0.0045 ดอลลาร์ต่อนาที ถูกกว่า GPT-4o Transcribe ราว 25% ขณะที่แบบสตรีมคิด 0.017 ดอลลาร์ต่อนาที
- โมเดลรองรับคอนเท็กซ์เป็นข้อความ รายการคีย์เวิร์ด และตัวช่วยระบุภาษา เพื่อเพิ่มความแม่นยำบนเสียงรบกวนสูง
โมเดลถอดเสียง OpenAI เข้าสู่ API นักพัฒนา
บริษัทได้เปิดตัวทั้งสองโมเดลผ่านแพลตฟอร์มนักพัฒนาเมื่อวันที่ 28 ก.ค. พร้อมเผยแพร่หน้าข้อมูลโมเดล คู่มือถอดเสียงฉบับปรับปรุง และโค้ดตัวอย่างสำหรับทุกเอ็นด์พอยต์ที่รองรับ GPT Transcribe ถูกออกแบบมาสำหรับไฟล์เสียงที่บันทึกเสร็จแล้วและงานแบตช์ขนาดใหญ่ สามารถประมวลผลเสียงได้เร็วกว่าความยาวจริงราว 34 เท่า เพียงพอสำหรับงานจัดเก็บคลังข้อมูล แต่ยังช้ากว่าผู้ให้บริการถอดเสียงเชิงพาณิชย์รายที่เร็วที่สุดในตลาด
GPT Live Transcribe รับงานอีกครึ่งหนึ่ง โดยถ่ายทอดข้อความแบบเรียลไทม์ผ่านการเชื่อมต่อขณะผู้พูดยังพูดอยู่ นักพัฒนาสามารถตั้งค่าจุดสมดุลระหว่างความหน่วง (latency) กับความนิ่งของข้อความถอดเสียงได้ และ Microsoft ได้บรรจุทั้งสองรุ่นลงในแพลตฟอร์ม Foundry ของตนแล้ว
ทั้งสองโมเดลรองรับการป้อนคำอธิบายไฟล์เสียงแบบข้อความล้วน รายการคีย์เวิร์ดสำหรับชื่อเฉพาะและศัพท์เทคนิค ตลอดจนตัวช่วยบอกแนวโน้มภาษาที่คาดว่าจะใช้ คอนเท็กซ์เหล่านี้ช่วยดันคะแนน “ความเข้าใจเชิงความหมาย” ในเบนช์มาร์กภายในของ OpenAI จาก 41.6% เป็น 45.2% โมเดลสำหรับไฟล์เสียงจะคิดค่าบริการที่ 0.0045 ดอลลาร์ต่อนาที ถูกกว่ารุ่นก่อนหน้าราวหนึ่งในสี่ ขณะที่แบบสตรีมมิงคิด 0.017 ดอลลาร์ต่อหนึ่งนาทีของเซสชันที่เชื่อมต่ออยู่
อ่านเพิ่มเติม: ปริมาณเทรดบน DEX ร่วง 26% เดือนก.ค. สภาพคล่องออนเชนหดตัว
Artificial Analysis จัด GPT Transcribe อยู่อันดับ 9 ด้านความแม่นยำ
Artificial Analysis ได้วัดผล GPT Transcribe ด้วยดัชนี AA-WER พบอัตราความผิดพลาดของคำที่ 3.31% จัดอยู่อันดับ 9 จากราว 50 ระบบที่บริษัทติดตามอยู่ ตัวเลขนี้ดีขึ้นจาก GPT-4o Transcribe ราว 0.7 จุดเปอร์เซ็นต์ แต่โมเดลยังมีปัญหากับคอนเทนต์ยาก ๆ โดยทำ WER ที่ 6.10% บนไฟล์ประชุมชี้แจงผลประกอบการ
บนชุดทดสอบ Common Voice ครอบคลุม 22 ภาษา OpenAI ทำค่า WER เฉลี่ย 19.27% เทียบกับ Whisper ที่ 40.37% ด้าน Alibaba ครองแชมป์ความแม่นยำที่ 1.8% เหนือ ElevenLabs, Google และ Mistral ซึ่งทำได้ในช่วง 2.2–2.9% อย่างไรก็ดี หนึ่งในรีวิวการเปิดตัวได้เตือนว่าตัวเลขดัชนีอาจมองโลกสวยเกินจริง เพราะ GPT-4o ตัวเดียวกันที่ทำได้ใกล้ 3% บนเสียงใสสะอาด กลับถอดเสียงไฟล์ผลประกอบการที่ยุ่งเหยิงได้แย่ลงมาก
เส้นทางผลิตภัณฑ์เสียงของ OpenAI นับจาก Whisper
การเปิดตัวครั้งนี้เป็นหมุดหมายใหม่ในปีที่ OpenAI เร่งเดินเกมด้านเสียง Whisper เปิดตัวในปี 2022 ในฐานะโมเดลโอเพนซอร์ส และกลายเป็นตัวเลือกมาตรฐานราคาถูกสำหรับงานถอดเสียงพอดแคสต์ คอลเซ็นเตอร์ ห้องข่าว และคลังวิจัยทั่วโลกอย่างรวดเร็ว
GPT-4o Transcribe ตามมาในปี 2025 ที่ราคา 0.006 ดอลลาร์ต่อนาที พร้อมรุ่นย่อที่ถูกลงครึ่งหนึ่ง ในเดือนพฤษภาคม บริษัทได้ปล่อย GPT-Realtime-2 ควบคู่ไปกับโมเดลแปลภาษา และ GPT-Realtime-Whisper ซึ่งรองรับการถ่ายทอดเสียงสดที่ราคา 0.017 ดอลลาร์ต่อนาทีเท่ากับโมเดลใหม่ในปัจจุบัน
ขณะเดียวกัน คู่แข่งยังเดินหน้าปรับลดราคาอย่างต่อเนื่อง โดย Mistral เริ่มต้นราคาถอดเสียงของตนที่ 0.003 ดอลลาร์ต่อนาที
อ่านต่อ: เอเยนต์หลุดคุมของ OpenAI เจาะเพิ่มอีก 4 บริการนอกเหนือจาก Hugging Face





