PDF-tekstintunnistus (OCR) — ilman lataamista
Aseta näkymätön, haettava tekstikerros skannattujen tai kuvana olevien PDF-sivujen päälle. Tunnistus tapahtuu täysin selaimessasi, tiedostoasi ei koskaan ladata.
Kolmessa vaiheessa
Avaa PDF
Vedä skannattu tai kuvapohjainen PDF ikkunaan tai valitse se.
Valitse kieli ja laajuus
Määritä tunnistuskieli ja päätä, tunnistetaanko vain nykyinen sivu vai koko dokumentti.
Vie tiedosto
Tallenna PDF haettavalla, näkymättömällä tekstikerroksella — sivukuva pysyy visuaalisesti muuttumattomana.
Tyypillinen tapaus: skannattujen dokumenttien tekeminen haettaviksi
Skannatut sopimukset, laskut tai kirjat sisältävät usein vain sivukuvan, ei aitoa tekstiä — niistä ei voi hakea eikä kopioida tekstiä. mousePDF tunnistaa tekstin paikallisesti selaimessa ja asettaa sen näkymättömästi kuvan päälle, jolloin haku ja kopiointi toimivat sivun ulkonäön muuttumatta.
Tekstintunnistus selaimessa — ja mikä siinä on erityistä
OCR kuuluu niihin tehtäviin, joissa muuten lähes väistämättä ladataan jotain: tunnistus tarvitsee kielimallin, ja se sijaitsee tavallisesti palvelimella. Täällä se toimii selaimessasi; ladataan vain malli, ei koskaan tiedostoasi.
Tämä on tärkeää juuri niissä dokumenteissa, jotka skannataan: sopimukset, palkkakuitit, lääkärinlausunnot, henkilötodistuskopiot. Skannaus on kuva — ja ennen kuin se on haettavissa, jonkin täytyy lukea se. Se, että tämä tapahtuu omalla laitteellasi omassa selaimessasi, on varsinainen ero.
28 kieltä on käytettävissä OCR:ää varten. Valitun kielen malli ladataan vasta varsinaisen ajon yhteydessä — sivu pysyy siksi kevyenä, ja lataat vain sen, mitä tarvitset.
Missä tunnistus kohtaa rajansa
Ei-latinalaiset kirjaimistot puuttuvat tarkoituksella. Ei kyrillistä, ei kiinaa, japania tai koreaa, ei arabiaa, hepreaa, devanagaria tai thaita. Niiden mallit ovat huomattavasti suurempia ja osuvuus selvästi alhaisempi — tulos, joka pitää korjata merkki kerrallaan, ei auta ketään. Kreikka on mukana, koska se ei tässä suhteessa kuulu samaan luokkaan.
Tunnistus ei ole koskaan virheetön. Se lukee pikseleistä takaisin sen, mikä joskus oli tekstiä. Siisti, suoraan skannattu tuottaa erittäin hyviä tuloksia; vino kännykkäkuva huonossa valossa, epäselvä käsiala tai epätavallinen koristekirjasin selvästi huonompia. Jos käytät tekstiä edelleen, se kannattaa tarkistaa — tämä pätee jokaiseen OCR-käsiteltyyn versioon, ei vain tähän.
Sivun ulkonäkö ei muutu. Tunnistettu teksti asetetaan näkymättömänä kerroksena kuvan päälle: näet edelleen skannauksesi, mutta voit hakea ja merkitä siitä. Tunnistusvirheet eivät siksi näy kuvassa — ne ilmenevät vasta, kun kopioit tekstiä ulos.
OCR on hyödyllinen myös PDF:n tiivistämisen jälkeen: silloin sivuista tulee kuvia ja ne menettävät tekstikerroksensa — tekstintunnistus luo sen uudelleen.
Usein kysytyt kysymykset
Ladataanko dokumenttini tekstintunnistusta varten palvelimelle? +
Ei. Tunnistus tapahtuu kokonaan selaimessa paikallisesti ladatulla OCR-moottorilla — tiedosto ei koskaan poistu laitteeltasi.
Mitä kieliä tuetaan? +
Laajempi valikoima eurooppalaisia kieliä latinalaisella tai kreikkalaisella kirjaimistolla. Kirjaimistoja kuten kiina, arabia, kyrillinen tai devanagari ei tällä hetkellä tueta OCR:ssä.
Kuinka kauan tunnistus kestää? +
Sivumäärästä ja laitteen tehosta riippuen muutamasta sekunnista muutamaan minuuttiin.
Muuttaako tekstintunnistus sivun ulkonäköä? +
Ei. Sivukuva pysyy täsmälleen samana, tunnistettu tekstikerros on näkymättömästi sen päällä — vain haku ja kopiointi tulevat sen myötä mahdollisiksi.
Kuinka hyvin tunnistus toimii huonosti skannatuissa tai käsinkirjoitetuissa dokumenteissa? +
Tunnistus toimii parhaiten siististi painetuissa, hyvin luettavissa teksteissä. Käsin kirjoitetuissa muistiinpanoissa tai voimakkaasti kohisevissa skannauksissa tarkkuus laskee — silloin yksittäisiä merkkejä voidaan tunnistaa väärin tai ne voivat puuttua.
Mitä kieliä tunnistetaan? +
28, kaikki latinalaisella kirjaimistolla sekä kreikka. Ei-latinalaiset kirjaimistot kuten kyrillinen, kiina, arabia, heprea tai thai eivät ole tarkoituksella mukana — osuvuus olisi siellä selvästi huonompi.
Kuinka tarkka tunnistus on? +
Siistissä, suorassa skannauksessa erittäin hyvä; vinoissa kännykkäkuvissa, huonossa valossa tai käsialassa selvästi huonompi. Jos käytät tekstiä edelleen, se kannattaa tarkistaa.
Näyttääkö dokumenttini erilaiselta tekstintunnistuksen jälkeen? +
Ei. Tunnistettu teksti tulee näkymättömänä kerroksena kuvan päälle — sivu näyttää samalta kuin ennen, mutta on nyt haettavissa.
Tästä voi myös olla apua
PDF:n tiivistäminen
Pienennä kuvapainotteisia PDF:iä huomattavasti — sivuista tulee tällöin kuvia.
Muunna PDF PDF/A-muotoon
Muunna arkistokelpoiseen PDF/A-muotoon — viranomaisille ja pitkäaikaissäilytykseen.
Muunna PDF Wordiksi
Vie PDF-teksti muokattavana Word-tiedostona — ilman lataamista.
Muokkaa PDF-tekstiä
Napsauta olemassa olevaa tekstiä PDF:ssä ja korvaa se uudella.