Dev.to · 2 min read

ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย

ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย

ThonburianTTS — AI พูดภาษาไทย ฟรี รันในเครื่องได้ โคลนเสียงได้ โดยคนไทย โดย Nokka (นก-กา) | 8 สิงหาคม 2569 บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ — Nokka (นก-กา) ถ้าคุณกำลังมองหา Text-to-Speech ภาษาไทยที่รันในเครื่องตัวเองได้ ไม่ต้องเสียค่า API และฟังดูเป็นธรรมชาติ — ThonburianTTS คือคำตอบที่น่าสนใจที่สุดในตอนนี้ พัฒนาโดยทีมวิจัยจาก Mahidol University ร่วมกับ Looloo Technology โมเดลนี้ถูกนำเสนอในงานประชุมวิชาการ iSAI-NLP 2025 และเปิดให้ใช้ฟรีบน HuggingFace กับ GitHub [1][2] บทความนี้จะพาไปดูว่า ThonburianTTS คืออะไร ใช้ทำอะไรได้บ้าง ข้อดีข้อเสีย และเหมาะกับใคร ThonburianTTS คืออะไร ThonburianTTS เป็น Text-to-Speech ภาษาไทยที่พัฒนาต่อยอดจาก F5-TTS (Flow Matching) สถาปัตยกรรมที่ใช้เทคนิค diffusion-based flow matching เพื่อสร้างเสียงพูดที่เป็นธรรมชาติ [1] จุดเด่นที่ทำให้ ThonburianTTS แตกต่างจาก TTS ทั่วไป: คุณสมบัติ รายละเอียด ภาษา ภาษาไทยเป็นหลัก (รองรับทั้ง Thai script และ IPA) Voice Cloning Zero-shot — ใช้เสียงตัวอย่างสั้นๆ (5-10 วินาที) เพื่อเลียนแบบเสียง การรัน Local — รันบนเครื่องตัวเองได้ทั้ง GPU และ CPU ขนาดโมเดล ~1.35 GB (ประมาณ 500M parameters) License โค้ด MIT, โมเดล CC BY-NC-SA 4.0 (ห้ามใช้เชิงพาณิชย์) ผู้พัฒนา Biomedical and Data Lab, Mahidol University + Looloo Technology ใช้ทำอะไรได้บ้าง ThonburianTTS เหมาะกับงานที่ต้องการเสียงพูดภาษาไทยที่เป็นธรรมชาติ โดยไม่ต้องพึ่ง API ภายนอก [1]: ระบบพากย์เสียงภาษาไทย — พากย์วิดีโอ, สื่อการสอน, audiobook AI Voice Bot ภาษาไทย — ทำ chatbot ที่พูดภาษาไทยได้ Voice Cloning ส่วนตัว — โคลนเสียงตัวเองหรือเสียงคนในทีม ระบบอ่านข้อความภาษาไทย — อ่านบทความ, ข่าว, เอกสาร งานวิจัยและพัฒนา — ต่อยอด TTS ภาษาไทยในเชิงวิชาการ จุดเด่นที่ทำให้ ThonburianTTS น่าสนใจ 1. เสียงภาษาไทยที่เป็นธรรมชาติ ThonburianTTS ถูก fine-tune บนข้อมูลภาษาไทยโดยเฉพาะ (GigaSpeech2) ทำให้ออกเสียงภาษาไทยได้ถูกต้องและเป็นธรรมชาติกว่าโมเดล multilingual ทั่วไป [1][3] ผู้ใช้หลายคนรายงานว่า ThonburianTTS ให้เสียงภาษาไทยที่ดีกว่า Qwen-TTS และ OmniVoice ซึ่งเป็นโมเดล multilingual ที่ไม่ได้ optimize สำหรับภาษาไทย 2. Voice Cloning แบบ Zero-Shot ใช้เสียงตัวอย่างสั้นๆ เพียง 5-10 วินาที ก็สามารถเลียนแบบเสียงต้นฉบับได้ โดยงานวิจัยต้นฉบับรายงาน similarity scores ที่ 84-89% [4] 3. รันในเครื่องได้ ไม่ต้องพึ่ง Cloud ติดตั้งผ่าน pip คำสั่งเดียว: pip install git+https://github.com/biodatlab/thonburian-tts.git ใช้ GPU (NVIDIA CUDA) หรือ CPU ก็ได้ — GPU จะเร็วกว่า แต่ CPU ก็รันได้ (ช้ากว่า) [1] 4. ปรับแต่งได้ ปรับความเร็วเสียง (speed control) ตัดช่วงเงียบ (silence trimming) รักษาสไตล์เสียงต้นฉบับ (voice style preservation) 5. มี Gradio Demo ให้ลองใช้ ทีมพัฒนาทำ Gradio Web UI ให้ลองใช้ผ่าน HuggingFace Spaces ได้ทันที โดยไม่ต้องติดตั้งอะไร [1] ข้อจำกัดที่ควรรู้ 1. ไม่เหมาะกับข้อความยาว งานวิจัย JaiTTS (2026) ระบุว่า ThonburianTTS "fails to generate sensible output" สำหรับข้อความยาว เพราะถูกเทรนบน GigaSpeech2 ซึ่งเป็นชุดข้อมูลที่เน้น utterances สั้นๆ [3] 2. Zero-shot cloning ยังมีข้อจำกัด ถึงแม้ similarity scores จะสูง (84-89%) แต่ JaiTTS paper ระบุว่า ThonburianTTS ยังมีข้อจำกัดด้าน zero-shot speaker cloning เมื่อเทียบกับโมเดลที่ใหม่กว่า [3] 3. License ห้ามใช้เชิงพาณิชย์ โค้ด: MIT (ใช้ได้อิสระ) โมเดล: CC BY-NC-SA 4.0 — ห้ามใช้ในเชิงพาณิชย์ ถ้าจะใช้ต้องขออนุญาตจากทีมพัฒนา [1] 4. ต้องการ VRAM ~2-3 GB F5-TTS ต้องการ VRAM ประมาณ 2-3 GB สำหรับ inference — ถ้าใช้ CPU จะช้ากว่ามาก [5] เปรียบเทียบกับโมเดลอื่น โมเดล ภาษา Voice Cloning License ขนาด จุดเด่น ThonburianTTS ไทย (หลัก) ✅ Zero-shot CC BY-NC-SA 4.0 ~1.35 GB เสียงไทยธรรมชาติ, รัน local Qwen-TTS หลายภาษา ✅ Apache 2.0 0.6B-1.7B หลายภาษา, แข็งแกร่ง OmniVoice หลายภาษา ✅ แตกต่างตามรุ่น แตกต่าง Voice cloning คุณภาพดี JaiTTS ไทย (หลัก) ✅ CC BY 4.0 ใหญ่กว่า ข้อความยาวได้, CER 1.94% สรุป: ThonburianTTS เหนือกว่าสำหรับงานภาษาไทยที่ต้องการความ natural และรัน local ได้ แต่ถ้าต้องการข้อความยาวหรือใช้เชิงพาณิชย์ ควรพิจารณา JaiTTS หรือ Qwen-TTS แทน เหมาะกับใคร เหมาะกับ นักพัฒนาไทย ที่อยากทำระบบ TTS ภาษาไทยโดยไม่เสียค่า API นักวิจัย ที่ต้องการต่อยอด TTS ภาษาไทย ผู้ใช้ทั่วไป ที่อยากลอง voice cloning ภาษาไทย งาน non-commercial — งานวิจัย, โปรเจกต์ส่วนตัว, งานอดิเรก เหมาะน้อยกว่า งานเชิงพาณิชย์ — ต้องขอ license เพิ่มเติม ข้อความยาว — ยังมีข้อจำกัด (แนะนำ JaiTTS แทน) เครื่องไม่มี GPU — CPU รันได้แต่ช้ามาก วิธีเริ่มต้นใช้งาน # 1. ติดตั้ง pip install git+https://github.com/biodatlab/thonburian-tts.git # 2. ติดตั้ง ffmpeg (Linux) sudo apt install ffmpeg # 3. รันตัวอย่าง python f5tts_thai_example.py หรือลองผ่าน Gradio Demo บน HuggingFace Spaces โดยไม่ต้องติดตั้ง [1] สรุป ThonburianTTS เป็น TTS ภาษาไทยที่รันในเครื่องได้ ฟรี และให้เสียงที่เป็นธรรมชาติ — พัฒนาโดยทีมวิจัยไทยจาก Mahidol University จุดเด่นคือ voice cloning แบบ zero-shot, เสียงภาษาไทยที่ natural, และรัน local ได้โดยไม่ต้องพึ่ง API ข้อจำกัดคือยังไม่เหมาะกับข้อความยาว, license ห้ามใช้เชิงพาณิชย์, และต้องการ GPU สำหรับความเร็วที่ดี ถ้าคุณกำลังมองหา TTS ภาษาไทยที่รันในเครื่องได้และฟรี — ThonburianTTS คือตัวเลือกที่ควรลอง แหล่งอ้างอิง [1] biodatlab. "ThonburianTTS — Thai Text-to-Speech based on F5-TTS". GitHub. 2025. https://github.com/biodatlab/thonburian-tts [2] biodatlab. "ThonburianTTS". HuggingFace. 2025. https://huggingface.co/biodatlab/ThonburianTTS [3] Karnjanaekarin et al. "JaiTTS: A Thai Voice Cloning Model". arXiv. 2026. https://arxiv.org/html/2604.27607 [4] Aung et al. "ThonburianTTS: Enhancing Neural Flow Matching Models for Authentic Thai Text-to-Speech". iSAI-NLP 2025. doi: 10.1109/iSAI-NLP66160.2025.11320472. https://doi.org/10.1109/iSAI-NLP66160.2025.11320472 [5] Spheron Blog. "Self-Host AI Voice Cloning on GPU Cloud: XTTS-2, F5-TTS, and OpenVoice V2". 2026. https://www.spheron.network/blog/self-host-voice-cloning-gpu-cloud-xtts-f5-tts-openvoice-v2/ คุณเคยลองใช้ ThonburianTTS หรือ TTS ภาษาไทยตัวอื่นไหม? คิดว่า voice cloning ภาษาไทยตอนนี้ถึงจุดที่ใช้จริงได้หรือยัง? แชร์มุมมองใต้บทความได้เลยครับ — Nokka ยินดีแลกเปลี่ยน

This is a summary aggregated from Dev.to. Read the complete article on the original site:

Read full article at Dev.to

More AI & Machine Learning News