दो-स्तंभ PDF की दोनों स्तंभ आपस में गुँथकर निकलते हैं
दो स्तंभों में सजे किसी शोध-पत्र का पाठ आप चुनते हैं, कॉपी करते हैं, Word में चिपकाते हैं — और बाएँ स्तंभ की एक पंक्ति के बाद दाएँ की एक पंक्ति आती है, बार-बार। दो अलग-अलग विवरण आपस में गुँथ जाते हैं और यह भी नहीं दिखता कि वाक्य कहाँ समाप्त हुआ।
कारण यह है कि PDF स्तंभ की कोई संरचना संचित नहीं करता। फ़ाइल में केवल निर्देश होते हैं: «इस निर्देशांक पर यह ग्लिफ़ बनाओ»। कहाँ एक स्तंभ आरंभ होता है और कहाँ दूसरा समाप्त, यह कहीं लिखा नहीं होता। कॉपी करना और पाठ निकालना पृष्ठ को ऊपर से नीचे, पंक्ति-दर-पंक्ति, बनाने के स्थान के अनुसार पढ़ता है, इसलिए एक ही ऊँचाई पर पड़े दोनों स्तंभ बारी-बारी, एक-एक पंक्ति करके उठा लिए जाते हैं।
इसलिए स्तंभों को पृष्ठ-सज्जा से दोबारा पढ़ना पड़ता है। PDFIntact पृष्ठ के खंड — पाठ, शीर्षक, तालिकाएँ, चित्र — पहले पहचानता है और उन्हें पढ़ने के क्रम में लौटाकर Word, Markdown तथा JSON में लिखता है। स्तंभ-सज्जा स्वयं दोहराई नहीं जाती: आपको पढ़ने के क्रम में सजा एक-स्तंभ दस्तावेज़ मिलता है।
अभी आज़माइए
अपने ही PDF पर जाँचिए
जाँच पूरी तरह आपके ब्राउज़र के भीतर चलती है। फ़ाइल कहीं नहीं भेजी जाती और खाता भी नहीं चाहिए। भुगतान से पहले ही देख लीजिए कि कितने पृष्ठ, तालिकाएँ और आकृतियाँ निकाली जा सकती हैं।
उदाहरण
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
अक्सर पूछे जाने वाले प्रश्न
- दो-स्तंभ PDF कॉपी करने पर स्तंभ क्यों गुँथ जाते हैं?
- क्योंकि PDF स्तंभ को स्तंभ के रूप में संचित नहीं करता। फ़ाइल में केवल «इस निर्देशांक पर यह ग्लिफ़ बनाओ» होता है, और कहीं यह अंकित नहीं कि एक स्तंभ कहाँ आरंभ होता है और दूसरा कहाँ समाप्त। कॉपी करना पृष्ठ को ऊपर से नीचे पंक्ति-दर-पंक्ति पढ़ता है, इसलिए एक ही ऊँचाई पर पड़े दोनों स्तंभ बारी-बारी, एक-एक पंक्ति करके उठते हैं।
- पढ़ने का क्रम कैसे लौटता है?
- पहले पृष्ठ के खंड — पाठ, शीर्षक, तालिकाएँ, चित्र — पहचाने जाते हैं, और कुछ भी लिखने से पहले उन्हें पढ़ने के क्रम में लौटाया जाता है। दो-स्तंभ सज्जा स्वयं दोहराई नहीं जाती: Word और Markdown को पढ़ने के क्रम में सजा एक-स्तंभ दस्तावेज़ मिलता है।
- पादटिप्पणियों और चित्र-शीर्षकों का क्या होता है?
- वे अपने अलग खंड बनकर, अनुच्छेद के रूप में, पढ़ने के क्रम में अपने स्थान पर आते हैं। हमारी जाँच में चित्र-शीर्षक पाठ से अलग रहे, पादटिप्पणी की रेखा के नीचे का सब कुछ अलग खंड बना, और पृष्ठ-संख्याएँ पाठ में नहीं मिलीं। वे Word की पादटिप्पणी नहीं बनतीं; अनुच्छेद के रूप में आती हैं।
- पाठ किन प्रारूपों में निर्यात हो सकता है?
- Word, Markdown और JSON। JSON में खंड का प्रकार, पृष्ठ-संख्या और पृष्ठ में स्थिति भी रहती है, इसलिए पता चलता है कि कोई अंश किस स्तंभ और किस स्थान से आया। मुख्य पाठ Excel में नहीं जाता: Excel निर्यात में केवल तालिकाएँ और ग्राफ़ होते हैं।
- पढ़ने का क्रम ठीक है तो क्या अक्षर भी ठीक हैं?
- ये दो अलग बातें हैं। पढ़ने का क्रम बना रह सकता है और फिर भी अक्षरों का पठन बिगड़ सकता है; एक नमूने में ठीक ऐसा ही हुआ। इसीलिए हर खंड पर विश्वसनीयता का चिह्न रहता है — पढ़ा गया, अनुमानित, या पढ़ा नहीं जा सका। परिणाम को मूल PDF से अवश्य मिलाइए।
किसी भी PDF को सभी लक्षणों पर जाँचिए/ किस प्रारूप में क्या आता है