Ovatko hiljaisuuden poisto ja täytesanojen poisto sama asia?

Eivät — ja sekaannus maksaa ihmisille oikeaa rahaa ja oikeaa aikaa. Hiljaisuuden poisto löytää äänestä jaksot, joissa ei tapahdu juuri mitään — lauseiden välisen aukon, tauon kun tarkistat muistiinpanojasi — ja leikkaa ne pois, jolloin tallenne lyhenee. Täytesanojen poisto kohdistuu ääniin, jotka oikeasti tuotit: puhetta pehmustaviin "öö", "ää", "niinku" ja "tota" -ilmaisuihin. Tallenne voi kärsiä kummasta tahansa ongelmasta, molemmista tai ei kummastakaan, eikä toisen korjaus tee mitään toiselle.

Miten amplitudipohjainen hiljaisuuden poisto toimii?

Hiljaisuuden poisto on signaalimatematiikkaa. Työkalu skannaa aaltomuodon ja kysyy kolme kysymystä: kuinka hiljainen hetken on oltava, jotta se lasketaan hiljaiseksi (kynnys), kuinka kauan hiljaisen jakson on kestettävä, ennen kuin se kannattaa leikata (hiljaisuuden vähimmäispituus), ja kuinka paljon hengitystilaa jokaisen leikkauksen ympärille jää (täyte). Kaikki, mikä ei läpäise yhtäkään kolmesta testistä, poistetaan, ja jäljelle jäävä puhe liitetään takaisin yhteen. Koko viritysprosessi käsitellään oppaassamme hiljaisuuden poistamisesta äänestä ja videosta.

Koska se mittaa vain äänenvoimakkuutta, tämä lähestymistapa on nopea, deterministinen ja kielestä riippumaton. Sen ei koskaan tarvitse ymmärtää yhtäkään sanomaasi sanaa — mikä on myös syy siihen, että se voi toimia kokonaan puhelimellasi, sekunneissa, lataamatta mitään verkkoon.

Miten AI-pohjainen täytesanojen poisto toimii?

Täytesanojen poisto lähtee transkriptista. Työkalu ajaa puheentunnistuksen tallenteellesi, merkitsee sanat ja sananosat, joita se pitää täytteenä, ja poistaa ne jaksot äänestä. Descript ja Cleanvoice ovat tunnettuja esimerkkejä tästä lähestymistavasta. Se on aidosti hyödyllinen — mutta se riippuu litteroinnin tarkkuudesta, se on kielikohtainen, ja koska puhemallit ovat raskaita, nämä työkalut käsittelevät äänesi yleensä pilvessä tilaus- tai minuuttipohjaisella hinnoittelulla.

Siihen liittyy myös harkintakysymyksiä, joita äänenvoimakkuusmittari ei koskaan kohtaa. "Niinku" on täytettä yhdessä lauseessa ja oikea sana seuraavassa, joten transkriptityökalut merkitsevät toisinaan sanoja, jotka halusit pitää — useimmat tarjoavat tarkistusvaiheen juuri tästä syystä.

Mikä ongelma tallenteessasi oikeasti on?

Kuuntele kuusikymmentä sekuntia ja tee diagnoosi. Jos tallenne tuntuu hitaalta, koska lauseiden välillä ei tapahdu mitään — pysähdyt, mietit, siemaiset kahvia, aloitat uudelleen — ongelma on hiljaisuus, ja amplitudipohjainen ajo muuttaa rytmin täysin. Jos tallenne etenee mutta jokainen lause alkaa "öö":llä tai nojaa "tota"-sanaan, ongelma on täytesanat, eikä mikään hiljaisuuden poistaja koske niihin, koska ne äänet ovat puhetta: ne ovat selvästi jokaisen järkevän kynnyksen yläpuolella.

Karkeana kaavana podcastit, luennot ja ruututallenteet kärsivät enemmän aukoista; hermostuneet ensiotot ja käsikirjoittamattomat haastattelut kärsivät enemmän täytesanoista. Pitkissä tallenteissa on usein molempia.

Poistaako SilenceRemover "öö":t ja "ää":t?

Ei — ja tästä kannattaa olla suora ennen kuin lataat mitään. [SilenceRemover](/) on kynnyspohjainen hiljaisuusleikkuri: se havaitsee hiljaiset aukot kynnyksen, hiljaisuuden vähimmäispituuden ja täytteen avulla ja poistaa ne laitteella ilman latausta verkkoon ja ilman tiliä. Se ei litteroi ääntäsi eikä poista täytesanoja. "Öö" on ääni, jonka tuotit, joten äänenvoimakkuustunnistimelle se on puhetta, ei hiljaisuutta. Jos pääongelmasi ovat puhemaneerit, tarvitset transkriptipohjaisen työkalun sen sijaan — tai sen lisäksi.

Vaihtokauppa kulkee myös toiseen suuntaan: transkriptityökalut ovat raskaampia, pilvipohjaisia ja tilaushintaisia, mikä on paljon koneistoa, jos tallenteesi ainoa vika on kuollut ilma.

Voiko molempia käyttää yhdessä?

Kyllä, ja viimeistellylle pitkän muodon äänelle yhdistelmä on yleinen. Aja transkriptipohjainen vaihe ensin: poista täytesanat siihen rakennetussa työkalussa, tarkista sen ehdottamat leikkaukset ja vie tulos. Aja sitten hiljaisuuden poisto sille viennille tiivistääksesi sen, mitä jää jäljelle. Tämä järjestys toimii paremmin yksinkertaisesta syystä — "öö":n poistaminen jättää usein jälkeensä tauon, jonka sisällä se istui. Täyte on poissa, mutta aukko säilyy, ja amplitudiajo on se, joka sulkee sen. Käänteinen järjestys tarkoittaa, että transkriptityökalu työskentelee jo tiivistetyllä äänellä ja sen poistot avaavat pieniä reikiä, jotka joudut sitten korjaamaan uudelleen.

Miksei yksi työkalu vain tee molempia?

Jotkut editointipaketit tarjoavat molemmat, mutta ne ovat kaksi erillistä moottoria konepellin alla, ja ero näkyy hinnassa ja yksityisyydessä. Amplitudianalyysi on tarpeeksi kevyttä toimiakseen yksityisesti puhelimessa. Transkriptipohjainen editointi tarvitsee puhemallin, mikä yleensä tarkoittaa äänesi lataamista verkkoon, käsittelyn odottamista ja laskennasta maksamista. Niiden niputtaminen tarkoittaa pilvihintojen maksamista silloinkin, kun tarvitsit vain kevyen puolikkaan — mikä on täsmälleen syy siihen, että keskittyneet, laitteella toimivat hiljaisuustyökalut ovat oma kategoriansa.

Kumpi kannattaa korjata ensin?

Jos korjaat vain yhden asian, korjaa hiljaisuus — se on yleensä suurempi voitto per vaivannäön minuutti ja leikkaa todellista kestoa yhdessä automaattisessa ajossa. Täytesanoja kannattaa usein käsitellä puhetapana: hidastaminen ja tauon pitäminen "öö":n sanomisen sijaan korjaa jokaisen tulevan tallenteen ilmaiseksi, ja jäljelle jäävä tauko on juuri sitä, minkä hiljaisuuden poistaja siivoaa. Ja pidä kolmas ongelma erillään mielessäsi — tasainen taustakohina tai hurina ei ole hiljaisuutta eikä täytettä; se raja käsitellään artikkelissa hiljaisuuden poisto vs melunpoisto.