Loại bỏ khoảng lặng và loại bỏ từ đệm có phải cùng một thứ?
Không — và sự nhầm lẫn này khiến người ta tốn tiền thật và thời gian thật. Loại bỏ khoảng lặng tìm những quãng âm thanh hầu như không có gì diễn ra — khoảng trống giữa các câu, quãng dừng khi bạn xem ghi chú — và cắt chúng đi để bản ghi ngắn lại. Loại bỏ từ đệm nhắm vào những âm bạn thực sự phát ra: "ừm", "à", "kiểu như" và "bạn biết đấy" độn vào lời nói. Một bản ghi có thể mắc một trong hai vấn đề, cả hai, hoặc không cái nào, và cách chữa vấn đề này không giúp gì cho vấn đề kia.
Loại bỏ khoảng lặng dựa trên biên độ hoạt động thế nào?
Loại bỏ khoảng lặng là toán học tín hiệu. Công cụ quét dạng sóng và đặt ba câu hỏi: một khoảnh khắc phải yên tĩnh đến mức nào để được tính là im lặng (ngưỡng), quãng yên tĩnh đó phải kéo dài bao lâu mới đáng cắt (độ dài khoảng lặng tối thiểu), và bao nhiêu khoảng thở nên được giữ lại quanh mỗi vết cắt (phần đệm). Bất cứ thứ gì không qua được cả ba bài kiểm tra sẽ bị loại bỏ, và phần lời nói còn lại được ghép nối lại. Toàn bộ quá trình tinh chỉnh được trình bày trong hướng dẫn của chúng tôi về loại bỏ khoảng lặng khỏi âm thanh và video.
Vì chỉ đo âm lượng, cách tiếp cận này nhanh, xác định, và không phụ thuộc ngôn ngữ. Nó không bao giờ cần hiểu một từ nào bạn nói — đó cũng là lý do nó có thể chạy hoàn toàn trên điện thoại của bạn, trong vài giây, mà không tải lên bất cứ thứ gì.
Loại bỏ từ đệm bằng AI hoạt động thế nào?
Loại bỏ từ đệm bắt đầu từ một bản chép lời. Công cụ chạy chuyển giọng nói thành văn bản trên bản ghi của bạn, gắn cờ những từ và mẩu từ nó coi là từ đệm, và xóa các đoạn đó khỏi âm thanh. Descript và Cleanvoice là những ví dụ nổi tiếng của cách tiếp cận này. Nó thực sự hữu ích — nhưng phụ thuộc vào độ chính xác của việc chép lời, gắn với từng ngôn ngữ, và vì các mô hình giọng nói rất nặng, những công cụ này thường xử lý âm thanh của bạn trên đám mây theo gói đăng ký hoặc tính phí theo phút.
Nó cũng đòi hỏi những phán đoán mà một máy đo âm lượng không bao giờ phải đối mặt. "Kiểu như" là từ đệm trong câu này nhưng là từ thật trong câu kế, nên các công cụ theo bản chép lời thỉnh thoảng gắn cờ những từ bạn muốn giữ — hầu hết đều có bước duyệt lại chính vì lý do đó.
Bản ghi của bạn thực sự mắc vấn đề nào?
Hãy nghe sáu mươi giây và chẩn đoán. Nếu bản ghi cảm giác chậm chạp vì không có gì diễn ra giữa các câu — bạn dừng, suy nghĩ, nhấp cà phê, bắt đầu lại — vấn đề là khoảng lặng, và một lượt xử lý dựa trên biên độ sẽ thay đổi hẳn nhịp độ. Nếu bản ghi trôi chảy nhưng câu nào cũng mở đầu bằng "ừm" hoặc dựa vào "bạn biết đấy", vấn đề là từ đệm, và không công cụ loại bỏ khoảng lặng nào chạm được vào chúng, vì những âm đó là lời nói: chúng nằm cao hơn hẳn mọi ngưỡng hợp lý.
Theo một quy luật thô, podcast, bài giảng và bản ghi màn hình khổ sở vì khoảng trống nhiều hơn; các bản quay đầu tiên đầy hồi hộp và phỏng vấn không kịch bản khổ sở vì từ đệm nhiều hơn. Bản ghi dạng dài thường có cả hai.
SilenceRemover có xóa "ừm" và "à" không?
Không — và đáng nói thẳng điều này trước khi bạn tải bất cứ thứ gì. [SilenceRemover](/) là công cụ cắt khoảng lặng dựa trên ngưỡng: nó phát hiện các khoảng trống yên tĩnh bằng ngưỡng, độ dài khoảng lặng tối thiểu và phần đệm, và loại bỏ chúng trên thiết bị, không tải lên và không tài khoản. Nó không chép lời âm thanh của bạn, và không xóa từ đệm. Một tiếng "ừm" là âm thanh bạn phát ra, nên với một bộ dò âm lượng, nó là lời nói, không phải khoảng lặng. Nếu vấn đề chính của bạn là tật nói, bạn cần một công cụ dựa trên bản chép lời để thay thế — hoặc bổ sung.
Sự đánh đổi cũng đúng theo chiều ngược lại: công cụ theo bản chép lời nặng hơn, chạy trên đám mây và tính phí đăng ký, một bộ máy quá cồng kềnh nếu điều duy nhất sai trong bản ghi của bạn là khoảng lặng.
Có thể dùng cả hai cùng nhau không?
Có, và với âm thanh dạng dài cần trau chuốt, sự kết hợp này khá phổ biến. Chạy lượt dựa trên bản chép lời trước: xóa từ đệm trong công cụ được xây cho việc đó, duyệt các vết cắt nó đề xuất, và xuất kết quả. Sau đó chạy loại bỏ khoảng lặng trên bản xuất đó để siết gọn phần còn lại. Thứ tự này hiệu quả hơn vì một lý do đơn giản — xóa một tiếng "ừm" thường để lại chính quãng dừng mà nó từng nằm trong đó. Từ đệm biến mất, nhưng khoảng trống còn đó, và lượt xử lý biên độ mới là thứ khép nó lại. Đảo ngược thứ tự nghĩa là công cụ chép lời làm việc trên âm thanh đã siết gọn, và các thao tác xóa của nó mở lại những lỗ hổng nhỏ mà bạn phải sửa thêm lần nữa.
Vì sao không có một công cụ làm cả hai?
Một số bộ chỉnh sửa quả thực cung cấp cả hai, nhưng bên dưới là hai cỗ máy riêng biệt, và sự khác biệt hiện ra ở chi phí và quyền riêng tư. Phân tích biên độ đủ nhẹ để chạy riêng tư trên điện thoại. Chỉnh sửa theo bản chép lời cần một mô hình giọng nói, thường đồng nghĩa với tải âm thanh lên, chờ xử lý, và trả tiền cho sức tính toán. Gộp chúng lại nghĩa là trả giá đám mây ngay cả khi bạn chỉ cần nửa nhẹ — đó chính là lý do các công cụ khoảng lặng chuyên biệt, chạy trên thiết bị tồn tại như một hạng mục riêng.
Nên sửa cái nào trước?
Nếu chỉ sửa một thứ, hãy sửa khoảng lặng — đó thường là thắng lợi lớn hơn trên mỗi phút công sức, cắt được thời lượng thực trong một lượt tự động. Từ đệm thường nên được xem như một thói quen trình bày: nói chậm lại và dừng thay vì "ừm" sẽ sửa mọi bản ghi tương lai miễn phí, và quãng dừng nó để lại chính là thứ mà công cụ loại bỏ khoảng lặng dọn sạch. Và hãy giữ vấn đề thứ ba tách biệt trong đầu — tiếng rít hay tiếng ù nền đều đặn không phải khoảng lặng cũng chẳng phải từ đệm; ranh giới đó được trình bày trong loại bỏ khoảng lặng vs khử tiếng ồn.
