Bir PDF gerçekte nedir ve metni neden her zaman kopyalayamazsınız

Bir PDF'in sözcükler yerine koordinatlara nasıl glif yerleştirdiği, taranmış bir belgenin gerçek metinden nasıl ayırt edileceği ve birleştirirken ya da bölerken yazı tiplerinin, sayfa kutularının, döndürme bayraklarının ve parolaların ne yaptığı.

Bir PDF, çizim yönergelerinden oluşan bir listedir. Şu glifi şu koordinata, şu yazı tipiyle, şu boyutta koy, sonra şuraya git ve bir sonrakini çiz der. Bu bir başlıktır, bu bir paragraftır, bu sütun ötekinden önce gelir demez. Bir okuyucunun sayfanın yapısı hakkında bildiği izlenimi veren her şey, izler arasındaki boşluklar ölçülerek sonradan yeniden kurulmuştur; PDF'lerde sinir bozucu olan şeylerin çoğunun açıklaması da budur.

Bir PDF gerçekte neyi saklar

Sayfadaki metin, kısa bir işleç dizisi olan bir içerik akışında yaşar:

BT
  /F1 11 Tf
  72 708 Td
  [(In) -18 (v) 22 (oice)] TJ
  180 0 Td
  (2026-08-25) Tj
ET

Tf bir yazı tipi ve boyut seçer, Td metin imlecini taşır, TJ ise araya kerning kaydırmaları koyarak glifleri çizer. Eksik olana dikkat edin: hiçbir yerde boşluk karakteri yok. Tarihten önceki aralık 180 birimlik bir sıçramadır ve bir çıkarıcının her sıçramanın boşluk mu, sekme mi, sütun sınırı mı, yoksa hiçbir şey mi olduğuna karar vermesi gerekir. Birazcık kaymış bir eşik size Invoice2026-08-25 ya da I n v o i c e verir.

Okuma sırasının da aynı sorunu vardır: glifler çizildikleri sırayla dışarı çıkar. İki sütunlu bir yerleşim çoğu zaman önce sol sütunu sayfa boyunca aşağı, sonra sağ sütunu çizer; bu durumda kopyalama çalışır. Üretici sayfayı satır satır, sayfanın enine çizdiyse kopyalama sütunları birbirine geçirip saçmalık üretir.

Metin PDF'ini taramadan ayırt etmek

Taranmış bir belgede hiç metin yoktur: bir PDF'e sarılmış bir sayfa fotoğrafıdır. Optik karakter tanıma resmin üzerine görünmez bir metin katmanı ekler ve bu, dosyayı aranabilir kılar; ama o katman bir tahmindir, dolayısıyla hataları başarısız aramalar ve bozuk kopyalar olarak yüzeye çıkar.

DenetimMetin PDF'iTaranmış PDF
Bir sözcük seçinKarakter karakter vurgularHiçbir şey seçilmez ya da bütün sayfa seçilir
%400'e yakınlaştırınHarfler keskin kalırHarfler yumuşar ya da bloklaşır
Sayfa başına boyutÇoğu zaman 20 ila 100 KBÇoğu zaman 300 KB ile birkaç MB arası
Extract Images from PDFGerçek resimleri ya da hiçbir şey döndürürSayfa başına bir tam sayfa görüntüsü döndürür

Yazı tipleri, gömme ve alt küme çıkarma

Bir yazı tipi ya gömülüdür, yani yazı tipi programı dosyanın içindedir, ya da adı ve ölçüleriyle anılır; bu durumda okuyucu onu gösteren makinede benzer bir şey bulur. Anılan yazı tipleri, bir belgenin yapıldığı yerde doğru, başka yerde yanlış görünmesinin nedenidir: yerine geçen yazı tipinin karakter genişlikleri farklıdır, dolayısıyla satırlar yeniden sarılır, tablolar taşar ve bir sayfalık bir mektup iki sayfa olur.

Gömülü yazı tiplerinin neredeyse hepsinden alt küme çıkarılmıştır. Yalnızca kullanılan glifler dosyaya girer ve bunlar sıklıkla yeniden numaralandırılır, dolayısıyla A harfinin glifi 3 numaralı kodda duruyor olabilir. Gerçek karakterlere geri eşleme ayrı bir ToUnicode tablosunda yaşar; bu tablo eksik ya da yanlış olduğunda sayfa kusursuz çizilir ama kopyalanan metin anlamsız gelir, çünkü elinize karakterler değil içerideki glif kodları verilir. Yeniden kaydetmek bunu onarmaz; çıkış yolları kaynak belge ya da çizilmiş sayfalar üzerinden karakter tanımadır.

Sayfa boyutu, kutular ve döndürme

Koordinatlar puntoyla, inç başına 72 olacak biçimde verilir ve her sayfa birkaç dikdörtgen taşır. MediaBox bütün yapraktır; CropBox ise gerçekte gösterilen ve daha küçük olabilen bölgedir.

BoyutPuntoMilimetre
A4595 x 842210 x 297
Letter612 x 792216 x 279
Legal612 x 1008216 x 356

A4 ile Letter ekranda birebir aynı görünür, kâğıtta ise ayrışır; dolayısıyla Avrupa'dan bir raporu Amerikan bir raporla birleştirmek, boyutu dönüşümlü değişen sayfalar verir.

Her sayfa ayrıca 0, 90, 180 ya da 270 derecelik bir döndürme bayrağı taşır, böylece yan saklanmış içerik dik gösterilebilir. Rotate PDF hiçbir şeyi yeniden çizmek yerine bu bayrağı ayarlar; bu da onu anında ve kayıpsız kılar, ama alttaki koordinatlar değişmez: bayrağı yok sayan bir araç metni yan çıkarır ve bayrakları karışık sayfaları birleştirmek, tutarlı görünen ama içeriği birkaç farklı yönde duran bir belge verir.

Birleştirme, bölme ve kırılan parçalar

Sayfalar bir sayfa ağacında yaşar. Merge PDF sayfa nesnelerini ve onların atıfta bulunduğu her şeyi tek bir dosyaya kopyalar ve o ağacı yeniden kurar; Split PDF ise ağacın bir dalını alır. Sayfalar sağlam gelir, belgeye iliştirilmiş olanlar her zaman gelmez.

  • Yer imleri, sayfa nesnelerini gösteren ayrı bir taslak yapısıdır. Birçok birleştirme aracı bunu tümüyle atar; bölme ise artık orada olmayan sayfalara nişan almış girdiler bırakır.
  • Form alanları sayfa düzeyinde değil belge düzeyinde adlandırılır, dolayısıyla bir formun iki kopyasını birleştirmek name adında iki alan verir; birçok okuyucu bunu ortak değeri olan tek bir alan sayar: birini doldurmak diğerini de doldurur. Önce düzleştirin ya da yeniden adlandırın.
  • Açıklamalar, örneğin bağlantılar ve yorumlar, sayfalarıyla birlikte yolculuk eder, ama hedef sayfası bölme sırasında dışarıda kalmış bir iç bağlantının gidecek yeri yoktur.

Birleştirilmiş bir dosya çoğu zaman parçalarının toplamından büyüktür, çünkü ortak kaynaklar çoğaltılır: aynı yazı tipinin bir alt kümesini gömen dört kaynak dört alt küme, üstüne dört renk profili ve dört üstveri bloğu verir. Daha küçük de çıkabilir, çünkü yeniden yazma kullanılmayan nesneleri ve kayıt geçmişini atar: otuz kez kaydedilmiş bir belge, önceki her revizyonu sonuna eklenmiş olarak taşır.

Parolalar, izinler ve etiketler

İki tür parola vardır ve bunlar karşılaştırılabilir değildir. Belgeyi açmak için kullanıcı parolası gerekir: içerik gerçekten de ondan türetilmiş bir anahtarla şifrelenmiştir, dolayısıyla o parola olmadan okunacak bir şey yoktur. Modern dosyalar AES-256, çok eski olanlar ise zayıf olan 40 bitlik RC4 kullanır.

Sahip parolası ise yazdırılamaz, kopyalanamaz ve düzenlenemez gibi izin bayraklarını ayarlar. Dosya yine şifrelidir, ama her okuyucunun kendi başına türetebileceği bir anahtarla, çünkü kullanıcı parolası boştur. Bayraklar bir ricadır; kimi okuyucu buna uyar, kimi yok sayar: bir dosya sormadan açılıyorsa özellikler penceresi ne derse desin kısıtlamaları tavsiye niteliğindedir.

Etiketleme ayrı bir katmandır: başlıkları, listeleri, tablo hücrelerini ve şekil açıklamalarını imleyen ve bir okuma sırası belirleyen isteğe bağlı bir yapı ağacı. Etiketli bir PDF'te ekran okuyucu belgeyi okur; etiketsiz bir PDF'te ise koordinatlardan tahmin yürütür ve kopyala yapıştırdakiyle aynı karmakarışık sonucu üretir. Taramalar tanımı gereği etiketsizdir, karakter tanıma metin ekler ama yapı eklemez; Images to PDF ya da PDF to Images çıktısında ise ikisi de yoktur.

Boyut nerede ve tarayıcı neyi tutabilir

Dosya boyutu neredeyse her zaman görüntülerdir. Bir A4 sayfası 150 dpi'de kabaca 1240 çarpı 1754, 300 dpi'de 2480 çarpı 3508 piksel ister; dolayısıyla 12 megapiksel olarak yerleştirilmiş bir fotoğraf, baskının kullanabileceğinden çok daha fazla veri taşır ve bir belgeyi güvenilir biçimde küçülten tek değişiklik aşağı örneklemedir. Yalnızca metinden oluşan bir PDF'i yeniden kaydetmek çok az kazandırır, çünkü içerik akışları zaten sıkıştırılmıştır; biri beklenmedik biçimde büyükse gömülü yazı tiplerine, kayıt geçmişine ya da eklere bakın.

Bütün bunlar tarayıcıda, yerel olarak gerçekleşir; dolayısıyla hiçbir şey yüklenmez ve sınır dosya boyutu değil bellektir. Pahalı olan kısım çizimdir: 4x ölçekte bir A4 sayfası yaklaşık 2380 çarpı 3368 pikseldir, yani tek sayfa için kabaca 32 MB sıkıştırılmamış bit eşlem; bu ölçekte elli sayfa da makineyi zorlamadan çok önce bir tarayıcı sekmesini tüketir. Çok büyük bir belgeyi önce bölün, sonra yığınlar halinde çalışın.