Căn chữ theo từng từ được nói, để phụ đề và chuyển động bám sát voice.
WhisperX bổ sung mốc thời gian từng từ và phân biệt lượt người nói quanh quy trình Whisper. Với video kể chuyện hoặc phỏng vấn, đây là dữ liệu để làm phụ đề bật theo lời và căn các chi tiết hình ảnh sát bản thu hơn.
Điểm nổi bật
- Căn timestamp mức từ bằng forced alignment.
- Xử lý theo batch với faster-whisper và lọc hoạt động giọng nói.
- Có speaker diarization và đầu ra hỗ trợ phụ đề tô sáng từ.
Dùng khi nào?
Dùng voice đã duyệt để tạo mốc từ, nhóm lại thành các câu ngắn cho phụ đề Shorts rồi nghe soát lần cuối.
Bắt đầu ra sao?
Ưu tiên bản PyPI ổn định; kiểm tra model alignment cho ngôn ngữ cần dùng. Diarization cần chấp nhận điều khoản model liên quan.
Mở hướng dẫn cài đặt chính chủCần biết trước khi dùng
Không coi nhận diện người nói là biết danh tính thật. Từ số, nhiễu và model alignment không phù hợp có thể lệch; token tải model phải giữ kín.
SẴN SÀNG CHO AI CỦA BẠN
Copy vào Gemini, Codex hoặc Claude. AI sẽ kiểm tra cách dùng và hỏi thông tin cần thiết để bắt đầu.
