Caption trước tiên

Caption YouTube vốn đã có timeline. Mono dùng timeline đó làm nguồn timing, sau đó cung cấp cho Gemini đủ ngữ cảnh xung quanh để dịch từng đơn vị lời nói tự nhiên hơn.

Dựng lại câu trước khi dịch

Auto caption thường chia một câu thành nhiều mảnh nhỏ. Mono gom các mảnh đó thành đơn vị lời nói có nghĩa, cố gắng giữ lượt thoại khi có thể, rồi mới dịch đơn vị đã dựng lại.

Khóa từng khối đã hoàn thành

Khi một khối được dịch và kiểm tra, Mono coi nó là Final rồi tiếp tục đi tới. Người xem có thể bắt đầu trong khi các khối phía sau vẫn tiếp tục hoàn thiện.

Vì sao tua và đổi tốc độ vẫn có thể khớp

Vì cue Final giữ timestamp gốc, cùng một câu dịch có thể được tìm lại sau pause, seek, replay hoặc đổi playback rate. Timing thuộc về timeline của video, không thuộc về thời điểm AI trả kết quả.