PDFIntact

अपने PDF से तालिकाएँ और मूल पाठ ज्यों का त्यों निकालें

इस PDF से कॉपी करने पर अक्षर बिगड़ जाते हैं

आप PDF में पाठ चुनते हैं, कॉपी करते हैं, चिपकाते हैं — और किसी बिल्कुल दूसरी लिपि की न पढ़ी जाने वाली अक्षर-शृंखला मिलती है। पर्दे पर पृष्ठ पूरी तरह ठीक दिखता है; टूटता वह कॉपी करते ही है।

कारण यह है कि PDF में अंतर्निहित फ़ॉन्टों में वह तालिका नहीं है जो हर ग्लिफ़ को किसी अक्षर-कोड से जोड़े — ToUnicode CMap। दिखाने के लिए इतना ही चाहिए कि «यह आकृति बनाओ», इसलिए उसके बिना भी पृष्ठ सही दिखता है। कॉपी करने के लिए अक्षर-कोड चाहिए, और कड़ी वहीं टूटती है। यह शोध-पत्रों, सरकारी दस्तावेज़ों और पुराने टाइपसेटिंग सॉफ़्टवेयर से बनी फ़ाइलों में आम है।

अक्षर बिगड़े नहीं हैं। पृष्ठ पर पढ़ी जा सकने वाली आकृतियाँ बनी हुई हैं। इसीलिए पृष्ठों को चित्र की तरह दोबारा पढ़ने से पाठ वापस मिल जाता है। फ़ॉन्ट बदलने या किसी दूसरे प्रोग्राम में चिपकाने से कुछ नहीं होगा — सूचना तो कॉपी करते ही खो चुकी थी।

अभी आज़माइए

अपने ही PDF पर जाँचिए

जाँच पूरी तरह आपके ब्राउज़र के भीतर चलती है। फ़ाइल कहीं नहीं भेजी जाती और खाता भी नहीं चाहिए। भुगतान से पहले ही देख लीजिए कि कितने पृष्ठ, तालिकाएँ और आकृतियाँ निकाली जा सकती हैं।

उदाहरण

実際のPDFからコピーした文字列

下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。

コピーした結果

ᆅ᪉බඹᅋయ࡟࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋ࡟ࡘ࠸࡚

PDFIntact で取り出した結果

地方公共団体における書面規制、押印、対面規制の見直しについて

お手元の文字列で判定する

コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。

判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。

अक्सर पूछे जाने वाले प्रश्न

Why does copying from a PDF produce garbled text?
Because the fonts embedded in the file are missing the table (the ToUnicode CMap) that says which character each glyph shape represents. The page displays correctly, but copying yields different characters. The text is not damaged — only the mapping is missing — so reading the pages as images recovers it.
Can the text be recovered from a garbled PDF?
Yes. PDFIntact reads the pages back as images and recovers the text with character recognition. The check runs entirely in your browser before you pay, so you can confirm it works on your file. Nothing is uploaded.
Will pasting into Word fix it?
No. The character codes are already lost at the point of copying, so the same corruption appears wherever you paste. Changing fonts does not help either.
How much does it cost?
A one-off charge based on page count: 160 JPY for 1–10 pages, 300 for 11–30, 550 for 31–60, 850 for 61–100 and 1,500 for 101–200. No account required. The check itself is free.

किसी भी PDF को सभी लक्षणों पर जाँचिएकिस प्रारूप में क्या आता है