๑๑11ภาพและเสียง (optional)
Image and voice on the i9
TL;DR — สรุปใน 30 วินาทีtldr
บทนี้ "เสริม" ไม่บังคับ — ถ้าอยากให้ AI วาดภาพ และ พูดภาษาไทย ได้เหมือนคลาวด์เต็มๆ เราใช้ ComfyUI หลายเตารวมกันเป็น "ครัว" เดียว + ตัวสังเคราะห์เสียงไทย VoxCPM2 และตัวถอดเสียง Whisper บน i9
เมื่อไหร่ควรใช้ / When to usewhen to use
ทำเมื่อมีเครื่องการ์ดจอ NVIDIA ว่างอยู่ (เราใช้ i9 + 2× RTX 5060 Ti + เครื่อง AMD อีกหนึ่งใบ) — ถ้าไม่มี ข้ามบทนี้ได้ ระบบหลักไม่กระทบ
- ครัวภาพเราเป็นแบบ "เตาหลายใบ": ComfyUI บน i9 GPU0 (:8188), GPU1 (:8190), และเครื่อง AMD อีกเตา — มีตัวจ่ายงาน (comfy-router) บน NAS คอยส่งงานไปเตาที่ว่างสุด
- เสียงพูดไทย: VoxCPM2 บน i9 (:9499) — ใช้ทั้งอ่านคำตอบเป็นเสียงและพากย์วิดีโอ
- ถอดเสียงเป็นตัวอักษร: Whisper (:9200) — ใช้ทำคำบรรยายวิดีโอ
วิธีทำ / How-tohow to
โครงสร้างครัว 3 เตา + ตัวจ่ายงาน:
- ติดตั้ง ComfyUI ทีละเตา (GPU หนึ่งใบต่อ instance, พอร์ตต่างกัน) — ดาวน์โหลดจาก github.com/comfyanonymous/ComfyUI
- ตั้งค่า เตาทุกใบเข้ากฎ GPULAW: หน้าต่างเรนเดอร์ภาพคือ 17:30–19:30 ของทุกวัน — นอกหน้าต่างให้ GPU ว่าง
- ตัวจ่ายงาน comfy-router (FastAPI) บน NAS :8788 รับคำขอเดียว แล้วส่งต่อเตาที่ยุ่งน้อยสุด (least-busy) — มี /free ให้ดูสถานะเตาแบบเรียลไทม์
- เสียง: รัน VoxCPM2 และ Whisper เป็น service บน i9 แล้วเปิดปุ่ม TTS/STT ในหน้า WebUI
- ทดสอบปลายทาง: ขอภาพจากหน้าแชท (พิมพ์ให้ "วาดรูป...") และกดปุ่มลำโพงอ่านคำตอบ
ภาพจริงของครัวทั้งสามเตาอยู่ในหัวข้อภาพประกอบด้านล่าง — จากระบบที่กำลังรันอยู่จริงตอนถ่าย
ถ้าติดตรงไหน → บทที่ ๑๖
ตัวอย่างการตั้งค่า / Config exampleconfig example
หลักการตั้งค่าครัวที่เราใช้จริง:
# เตาหนึ่ง = GPU หนึ่งใบ = พอร์ตหนึ่งตัว
i9 GPU0 :8188 (ComfyUI — งานภาพทั่วไป)
i9 GPU1 :8190 (ComfyUI — งาน PuLID ติดหน้าคน)
AMD :8188 (ComfyUI — เตาที่สาม รับล้น)
# ตัวจ่ายงานบน NAS
comfy-router :8788
POST /generate -> ส่งไปเตาที่ว่างสุดอัตโนมัติ
GET /free -> ดู VRAM คงเหลือของทุกเตา
# เสียงบน i9
VoxCPM2 TTS :9499 (ข้อความไทย -> เสียงพูด)
Whisper STT :9200 (เสียง -> ข้อความ, ใช้ทำซับไทย)กฎ GPULAW 17:30–19:30 ถูกเขียนอยู่ในตารางงานของ router โดยตรง — นอกเวลา งานเข้าคิวไม่รีบเตา
Pro tip — เคล็ดลับจากสนามจริงpro tip
คำถามที่พบบ่อย / FAQfaq
ถาม: การ์ดจอเก่า ๆ ใช้ได้ไหม? — RTX 16GB รุ่นไหนก็เริ่มได้ ถ้าน้อยกว่านั้นต้องเลือกโมเดลภาพเล็กลง (SDXL แทน Flux)
ถาม: เสียงไทยเนียนแค่ไหน? — ระดับ "ฟังเข้าใจสบาย พากย์งานจริงได้" เราใช้ผลิตวิดีโอ YouTube จริงทุกสัปดาห์ (ตัวอย่างอยู่ที่ YouTube @icafefx)
คำถามอื่น ๆ ดูที่ FAQ
ดูเพิ่ม / See alsosee also
- บทที่ ๒ · สถาปัตยกรรม — ตำแหน่งของครัวในภาพใหญ่
- บทที่ ๑๔ · Content pipeline — ผู้ใช้ภาพหนักที่สุดของครัว
ภาพประกอบ / Figuresfigures



