Siirry sisältöön
FileSlimmer
Työkalut
Oppaat

Miksi PDF:ni tuskin pieneni?

Viimeksi tarkistettu

Pakkasin PDF:n ja koko putosi 4,1 MB:stä 4,0 MB:hen. Onko työkalu rikki?

3 min lukuaika · tarkistettu 17. elokuuta 2026

PDF on arkistokaappi

Pettymyksen aiheuttava ajatusmalli on se, että PDF:ää pidetään asiakirjan kuvana. Se ei ole sitä. PDF on ISO 32000:n määritelmän mukaan säiliö numeroituja objekteja: sivupuita, piirto-operaattoreita täynnä olevia sisältövirtoja, upotettuja fonttiohjelmia, image XObject -objekteja, lomakekenttiä, merkintöjä, kirjanmerkkirakenteita ja ristiviittaustaulukon, joka kertoo mistä kukin objekti alkaa.

Suurin osa noista objekteista on jo pakattu. Sisältövirrat on yleensä koodattu Flate-menetelmällä, joka on sama algoritmi kuin ZIP-tiedostossa. Upotetut valokuvat on tavallisesti tallennettu DCT-virtoina, eli JPEG-datana sellaisenaan. Kun yleiskäyttöinen pakkaaja siis katsoo PDF:ää, se katsoo laatikollista asioita, joista jokainen on jo kertaalleen pakattu.

Selvitä missä tavut ovat, ennen kuin pakkaat mitään

Hyödyllisin yksittäinen tarkistus on tietää, minkä tyyppinen asiakirja on kyseessä, koska se ennustaa lopputuloksen lähes täydellisesti.

Mikä hallitsee PDF:n kokoa asiakirjatyypeittäin
AsiakirjatyyppiMissä tavut ovatMitä rakenteellinen tallennus voi tehdä
Tekstinkäsittelyohjelman raporttiUpotetut fonttiohjelmat ja pienet sisältövirratHyvin vähän; sisältö on jo tiivistä
Skannatut sivutYksi suuri kuva sivua kohtiLähes ei mitään, jos kuviin ei kosketa
Esityksestä viety tiedostoUpotetut valokuvat ja liukuväritJonkin verran, jos samat kuvat toistuvat dioissa
Tekninen piirustusPitkät vektorisisältövirratJonkin verran, pakkaamalla virrat uudelleen ja poistamalla käyttämättömät objektit
Lomake liitteineenUpotetut tiedostot, JavaScript, merkintöjen sanakirjatPaljon, jos ylimääräiset ovat poistettavissa

Mitä rakenteellinen tallennus oikeasti poistaa

Rakenteellinen tallennus kirjoittaa asiakirjan uudelleen muuttamatta yhdenkään sivun ulkoasua. Se voi pudottaa objektit, joihin mikään ei enää viittaa ja joita kertyy joka kerta kun asiakirjaa muokataan ja tallennetaan lisäyksinä. Se voi pakata ristiviittaustaulukon ja koota pienet objektit objektivirtoihin. Se voi pudottaa asiakirjan metatiedot, esikatselukuvat ja sen muokkaushistorian, jonka jotkin tuottajaohjelmat jättävät jälkeensä.

Asiakirjassa, jota on muokattu ja tallennettu uudelleen monta kertaa, se voi olla iso voitto. Asiakirjassa, joka on viety kerran siististi tekstinkäsittelyohjelmasta, ei ole mitään kerättävää: tiedosto on jo lähellä pienintä muotoaan, ja sata kilotavua pois neljästä megatavusta on täsmälleen odotettava tulos.

Miksi tekstiasiakirja vastustaa

Teksti-PDF:ssä suuri osa tiedostosta on yleensä upotettuja fontteja. Fonttiohjelma on tiivis binääri, joka sisältää merkkien ääriviivat ja vihjeistysohjeet, ja se on mukana siksi, että asiakirjan on piirryttävä samanlaisena koneella, johon kyseistä kirjasinta ei ole asennettu. Sitä ei saa pakattua pois muuten kuin karsimalla se pienemmäksi osajoukoksi tai poistamalla se, ja poistaminen muuttaa sivun ulkoasua.

Itse teksti on pieni. Sata sivua tekstiä on muutama sata kilotavua merkkejä ennen pakkausta. Jos teksti-PDF:si on iso, katso fontteja ja tekstin taakse piiloutuvia kuvia – ylätunnisteessa toistuvaa logoa, taustan vesileimaa – äläkä sanoja.

Miksi skannaus romahtaa

Skannattu sivu on yksi iso valokuva paperiarkista, usein otettuna 300 pisteen tarkkuudella tuumaa kohti tai suuremmalla. A4-sivu 300 DPI:n tarkkuudella on noin 2480 × 3508 pikseliä – lähes yhdeksän miljoonaa pikseliä sivulla, jonka tietosisältö on muutama kilotavu tekstiä. Siksi skannaukset reagoivat niin voimakkaasti rasteroivaan pakkaukseen: renderöintitarkkuuden laskeminen ja sivukuvien uudelleenpakkaus käy suoraan sen kimppuun, mikä tiedostossa oikeasti on suurta.

Se on myös syy siihen, miksi kyseinen tila on tuhoava. Kun sivu on kerran kuva, haettava tekstikerros, linkit, lomakekentät, merkinnät, saavutettavuutta varten tehty tagirakenne ja mahdollinen digitaalinen allekirjoitus ovat poissa. FileSlimmer pitää rasterointia erillisenä, selkeästi merkittynä tilana, johon tuo varoitus on liitetty, eikä hiljaisena varavaihtoehtona silloin kun rakenteellinen tallennus tuottaa pettymyksen.

Miksi kukaan ei voi luvata sinulle lukua

PDF:n tavoitekoko on haku renderöintitarkkuuden ja kuvanlaadun yli, ja haulla on alaraja: jonkin tarkkuuden alapuolella skannauksen teksti lakkaa olemasta luettavaa. Se, yltääkö tietty asiakirja tiettyyn budjettiin tuon alarajan yläpuolella, riippuu sivumäärästä, musteen peitosta, valokuvasisällön määrästä ja skannerin kohinasta. Kaksi saman sivumäärän asiakirjaa voivat päätyä hyvin eri kokoihin.

Rehellinen toimintatapa on pysähtyä alarajalle ja kertoa, mihin haku pysähtyi, ja juuri niin FileSlimmerin PDF-tavoiteasetukset tekevät. Työkalu, joka osuu aina kirjoittamaasi lukuun, joko valehtelee luvusta tai tuhoaa asiakirjan päästäkseen siihen.

Ennen kuin syytät työkalua

  • Tarkista, onko PDF skannaus. Kokeile maalata tekstiriviä: jos kursori ei valitse mitään, jokainen sivu on kuva.
  • Vertaa sivumäärää kokoon. Kolmesivuinen 40 MB:n tiedosto on kuvapainotteinen; 900-sivuinen 40 MB:n tiedosto voi olla täysin järkevä.
  • Tarkista, onko asiakirja salattu. Salasanalla suojattua PDF:ää ei voi järjestellä uudelleen lainkaan ennen kuin se on avattu.
  • Tarkista, onko se allekirjoitettu. Allekirjoitetun asiakirjan uudelleenkirjoitus mitätöi allekirjoituksen, ja se on yleensä huonompi lopputulos kuin iso tiedosto.
  • Tarkista, mitä oikeasti tarvitset. Niiden kuuden sivun erottaminen, jotka sinun on lähetettävä, voittaa usein kaikkien yhdeksänkymmenen pakkaamisen.

Työkalut tähän

Lähteet

Lisää oppaita

Kaikki FileSlimmerin oppaat