Google เปิด Gemini 3.5 Transcribe รองรับภาษาไทย ถอดเสียงพร้อมตัด “เอ่อ อืม” และจัดข้อความให้อัตโนมัติ

  •  
  •  
  •  
  •  
  •  

Google เปิดตัว Gemini 3.5 Transcribe โมเดล Speech-to-Text รุ่นใหม่สำหรับแปลงเสียงพูดเป็นข้อความ พร้อมความสามารถในการจัดการภาษาพูด จัดรูปแบบข้อความ แยกผู้พูด และถอดเสียงแบบ Real-time

สิ่งที่น่าสนใจคือ Smart Transcription ซึ่งช่วยตัดคำฟุ่มเฟือยอย่าง “เอ่อ” หรือ “อืม” จัดการคำพูดซ้ำ รวมถึงเข้าใจการแก้คำพูดกลางประโยค ก่อนจัดข้อความให้อยู่ในรูปแบบที่อ่านง่ายขึ้น เช่น ย่อหน้า Bullet วันที่ ตัวเลข หรือสกุลเงิน

Gemini 3.5 Transcribe รองรับมากกว่า 85 ภาษา โดยมีภาษาไทยอยู่ในรายชื่อภาษาที่รองรับอย่างเป็นทางการ

เลือกได้ว่าจะถอดเสียงแบบไหน

โดย Gemini 3.5 Transcribe มีรูปแบบการถอดเสียง 2 แบบ

Verbatim ถอดคำพูดตามเสียงที่เกิดขึ้นจริง รวมคำฟุ่มเฟือย การพูดซ้ำ และการแก้คำพูดกลางประโยค เหมาะกับงานที่ต้องการเก็บรายละเอียดของบทสนทนา เช่น การสัมภาษณ์ งานวิจัย หรือการถอดเทป

Smart Transcription ใช้ AI ช่วยจัดการภาษาพูดให้เป็นข้อความที่อ่านง่ายขึ้น ระบบสามารถตัดคำฟุ่มเฟือย จัดการคำซ้ำและ Self-correction รวมถึงจัดรูปแบบข้อความให้อัตโนมัติ

ตัวอย่างเช่น หากผู้พูดบอกว่า “นัดกันวันอังคาร เอ๊ะ ไม่ใช่ วันพุธ บ่ายสอง” ระบบสามารถจัดข้อความสุดท้ายให้เป็นการนัดหมายวันพุธ เวลา 14.00 น.

ความสามารถนี้ช่วยลดขั้นตอนการเกลาข้อความหลังถอดเสียง และสามารถนำไปใช้กับงานประเภท Transcript การสรุป Meeting การถอดบทสัมภาษณ์ Caption หรือการวิเคราะห์บทสนทนาใน Call Center

แยกผู้พูด พร้อมเข้าใจศัพท์เฉพาะ

นอกจากนี้ Gemini 3.5 Transcribe ยังรองรับ Speaker Diarization หรือการแยกว่าเสียงแต่ละช่วงเป็นของผู้พูดคนใด โดยรองรับได้สูงสุด 8 คน

ระบบยังมี Word-level Timestamp สำหรับระบุเวลาของแต่ละคำ และ Custom Vocabulary ที่สามารถเพิ่มคำศัพท์เฉพาะได้สูงสุด 1,000 คำ เช่น ชื่อสินค้า ชื่อบริษัท ตัวย่อ หรือศัพท์เฉพาะของแต่ละอุตสาหกรรม

อีกฟีเจอร์หนึ่งคือ Code-switching ที่รองรับบทสนทนาซึ่งมีการสลับหลายภาษา และสามารถตรวจจับภาษามากกว่า 85 ภาษาโดยอัตโนมัติ

สำหรับภาษาไทย Google ระบุ th-TH อยู่ใน Supported Languages อย่างเป็นทางการ ทำให้นักพัฒนาสามารถนำ Gemini 3.5 Transcribe ไปใช้กับงานถอดเสียงภาษาไทยผ่าน Gemini API ได้

มี Live Transcription สำหรับงาน Real-time

Google มีโมเดล gemini-3.5-transcribe-live สำหรับงานที่ต้องถอดเสียงแบบ Streaming ผ่าน WebSocket ซึ่งหมายความว่า ระบบสามารถรับเสียงเข้ามาและทยอยแปลงเป็นข้อความได้ทันที โดยไม่ต้องรอให้ผู้ใช้พูดจบหรืออัปโหลดไฟล์เสียงทั้งหมดก่อน

จุดเด่นของโมเดลนี้คือการออกแบบให้มี Latency ต่ำ หรือมีความหน่วงระหว่างเสียงพูดกับข้อความที่แสดงผลน้อย จึงเหมาะกับงานที่ต้องตอบสนองแบบทันที เช่น Voice Interface ที่ผู้ใช้พูดคุยกับระบบด้วยเสียง, Live Caption ที่แสดงคำบรรยายระหว่างการพูด หรือบริการที่ต้องประมวลผลเสียงแบบ Real-time

อย่างไรก็ตาม ฟีเจอร์บางอย่างยังมีข้อจำกัดในการใช้งาน โดย Speaker Diarization ซึ่งเป็นการแยกว่าช่วงเสียงนั้นเป็นของผู้พูดคนใด และ Word-level Timestamp ซึ่งเป็นการระบุเวลาที่แต่ละคำถูกพูด ปัจจุบันรองรับกับการประมวลผลไฟล์เสียงเป็นหลัก ยังไม่ได้รองรับในโหมด Live Transcription แบบ Streaming

Google ระบุว่า Gemini 3.5 Transcribe พัฒนาต่อจาก Chirp 3 ซึ่งเป็นเทคโนโลยี Speech Recognition รุ่นก่อนหน้า โดยผลทดสอบจาก Artificial Analysis พบว่า Time to Final Transcription หรือเวลาตั้งแต่เริ่มส่งเสียงเข้าไปจนระบบสร้าง Transcript ฉบับสุดท้ายเสร็จสมบูรณ์ ดีขึ้นประมาณ 70% เมื่อเทียบกับรุ่นก่อนหน้า

ตัวเลขนี้ไม่ได้หมายความว่าระบบจะถอดเสียงได้เร็วขึ้น 70% ในทุกสถานการณ์ แต่หมายถึงระยะเวลาที่ต้องรอจนได้ข้อความฉบับสมบูรณ์ลดลงอย่างมีนัยสำคัญ ทำให้เหมาะกับแอปพลิเคชันที่ต้องการแสดงผลการถอดเสียงอย่างรวดเร็วและต่อเนื่อง

ราคาเริ่มประมาณ 0.005 ดอลลาร์ต่อนาที

โดย Gemini 3.5 Transcribe มี Free Tier สำหรับทดลองใช้งาน

สำหรับ Paid Tier การประมวลผลไฟล์เสียงมีค่าใช้จ่ายรวมโดยประมาณ 0.005 ดอลลาร์ต่อนาที (ประมาณ 0.18 บาทต่อนาที) ส่วน Gemini 3.5 Transcribe Live อยู่ที่ประมาณ 0.009 ดอลลาร์ต่อนาที (ประมาณ 0.32 บาทต่อนาที)

Google เปิด Gemini 3.5 Transcribe ให้นักพัฒนาทดลองใช้งานแบบ Public Preview ผ่าน Gemini API และ Google AI Studio

ทั้งนี้ Gemini 3.5 Transcribe แสดงให้เห็นทิศทางของ Speech-to-Text ที่ครอบคลุมขั้นตอนหลังการถอดเสียงมากขึ้น ระบบสามารถจัดการลักษณะเฉพาะของภาษาพูด และเตรียมข้อความให้อยู่ในรูปแบบที่นำไปใช้งานต่อได้เร็วขึ้น

สำหรับคนทำคอนเทนต์ นักข่าว นักวิจัย ทีม Customer Service หรือธุรกิจที่มีข้อมูลเสียงจำนวนมาก ฟีเจอร์อย่าง Smart Transcription, Speaker Diarization และการรองรับภาษาไทย จึงมีโอกาสช่วยลดเวลาในการจัดการไฟล์เสียงและ Transcript ได้อย่างมีนัยสำคัญ


  •  
  •  
  •  
  •  
  •