PDFIntact

अपने PDF से तालिकाएँ और मूल पाठ ज्यों का त्यों निकालें

PDF से टेक्स्ट न निकलने पर OCR, टेक्स्ट लेयर रिकवरी और लेआउट पुनर्रचना में सही तरीका चुनना

OCR बनाम PDF टेक्स्ट एक्सट्रैक्शन: कन्वर्ज़न से पहले 3 जांच

टेक्स्ट चयन, कॉपी-पेस्ट और लेआउट की जांच से तय करें कि PDF को OCR, मौजूदा टेक्स्ट लेयर की रिकवरी या तालिका व पढ़ने के क्रम की पुनर्रचना चाहिए।

PDFIntact संपादकीय टीमप्रकाशित

PDF से टेक्स्ट न निकलने पर हर बार OCR जरूरी नहीं

PDF से टेक्स्ट सही न मिलने पर तुरंत OCR चलाना हमेशा सही समाधान नहीं है। अधिकतर समस्या वाली फ़ाइलें इन तीन स्थितियों में आती हैं:

  1. पृष्ठ केवल इमेज है और उसमें टेक्स्ट डेटा नहीं है।
  2. टेक्स्ट डेटा मौजूद है, लेकिन दिखाई देने वाले अक्षरों और कॉपी होने वाले अक्षरों का संबंध टूटा हुआ है।
  3. अक्षर निकलते हैं, लेकिन तालिका या दो-कॉलम लेआउट की संरचना खो जाती है।

पहली स्थिति में इमेज से अक्षर पहचानने के लिए OCR चाहिए। दूसरी में मौजूदा जानकारी और दिखाई देने वाले रूप को मिलाकर टेक्स्ट दोबारा बनाना पड़ सकता है। तीसरी मुख्यतः लेआउट पुनर्रचना की समस्या है, अक्षर पहचान की नहीं। तरीका चुनने से पहले ये तीन जांच करें।

जांच 1: क्या टेक्स्ट चुना जा सकता है?

PDF देखने वाले प्रोग्राम में फ़ाइल खोलें और एक वाक्य पर संकेतक खींचें।

कुछ भी नहीं चुना जाता

पूरा पृष्ठ एक इमेज हो सकता है। स्कैन किए गए दस्तावेज़ों में यह आम है और OCR के लिए उपयुक्त स्थिति है।

दस्तावेज़ की अनुमतियां या उसे देखने वाला प्रोग्राम भी चयन रोक सकते हैं। टेक्स्ट परत नहीं है मानने से पहले किसी दूसरे मानक PDF प्रोग्राम में जांचें।

टेक्स्ट के आकार का क्षेत्र चुना जाता है

PDF में किसी तरह की टेक्स्ट परत है। नया OCR जोड़ने से पहले छोटा नमूना कॉपी करके देखें। दूसरी OCR परत जोड़ने पर अक्षर दोहरे हो सकते हैं, जिससे खोज और कॉपी दोनों कठिन होते हैं।

जांच 2: एक वाक्य कॉपी करने पर क्या मिलता है?

छोटा अनुच्छेद सादा-पाठ संपादक में पेस्ट करें और परिणाम पहचानें:

परिणाम संभावित स्थिति अगला कदम
वाक्य सही आता है टेक्स्ट लेयर उपयोगी है तालिका, कॉलम और संरचना जांचें
अलग अक्षर आते हैं दिखाई देने वाली अक्षर-आकृतियां सही अक्षरों से नहीं जुड़ीं दृश्य रूप से टेक्स्ट पुनर्निर्मित करें
खाली परिणाम आता है टेक्स्ट लेयर अधूरी है या पृष्ठ इमेज है दूसरे पृष्ठ भी देखें
शब्दों का क्रम गलत है कॉलम या वस्तुओं के क्रम की समस्या है पढ़ने का क्रम दोबारा बनाएं
हर अक्षर दो बार आता है इमेज और OCR परत एक साथ हो सकती हैं निष्कर्षण से पहले दोहरा पाठ साफ करें

एक पृष्ठ से पूरी PDF का निर्णय न करें। सामान्य मुख्य पृष्ठ, तालिका वाला पृष्ठ और अंतिम भाग का पृष्ठ जांचें। एक ही दस्तावेज़ में स्कैन और डिजिटल रूप से बनाए गए पृष्ठ मिले हो सकते हैं।

जांच 3: अक्षर सही हैं, लेकिन संरचना टूटी है?

मुख्य पाठ सही कॉपी होने का अर्थ यह नहीं कि निष्कर्षण उपयोग योग्य है। तालिका एक कॉलम में आ सकती है, दो-कॉलम पेपर के बाएं-दाएं हिस्से मिल सकते हैं, या सूत्र में ऊर्ध्वलिपि, अधोलिपि और भिन्न का संबंध मिट सकता है। यहां अक्षर पहचाने गए हैं; संरचना गायब है।

तालिकाओं के लिए

सेल की सीमाएं, मर्ज किए शीर्षक और पंक्ति-कॉलम संबंध दोबारा बनाएं। अधिक OCR टेक्स्ट जोड़ने से तालिका की सेल संरचना वापस नहीं आती।

दो-कॉलम पृष्ठों के लिए

हर अक्षर को केवल पृष्ठ की स्थिति से क्रम देने के बजाय इच्छित क्रम तय करें—आमतौर पर पहले बायां कॉलम, फिर दायां।

सूत्रों के लिए

ऊर्ध्वलिपि, अधोलिपि, भिन्न और मूल चिह्न को अक्षरों की सपाट शृंखला के बजाय गणितीय संरचना के रूप में दिखाना होगा।

OCR और मौजूदा टेक्स्ट में से क्या उपयोग करें

PDF की स्थिति OCR मौजूदा टेक्स्ट लेयर संरचना पुनर्रचना
केवल स्कैन इमेज जरूरी उपलब्ध नहीं तालिका या कॉलम हों तो जरूरी
कॉपी किया टेक्स्ट बिगड़ा है दृश्य रिकवरी में कभी-कभी उपयोगी स्थान के संकेत दे सकती है लेआउट पर निर्भर
मुख्य पाठ सही कॉपी होता है आमतौर पर अनावश्यक उपयोग करें तालिका, कॉलम या सूत्र में जरूरी
OCR टेक्स्ट दोहरा आता है नई परत न जोड़ें दोहराव हटाएं या मिलाएं जरूरत के अनुसार

“खोज योग्य” या “OCR से संसाधित” लिखा होना उपयोगी टेक्स्ट परत की गारंटी नहीं है। चयन, कॉपी की शुद्धता, पढ़ने का क्रम और तालिका संरचना अलग-अलग जांचें।

दोबारा OCR से पहले मूल फ़ाइल बचाएं

नई टेक्स्ट परत बनाते समय स्रोत PDF को अधिलेखित न करें। मूल PDF, संसाधित PDF और निकाला हुआ आउटपुट अलग फ़ाइलों में रखें ताकि पहले और बाद की तुलना हो सके।

हर फ़ाइल के नाम में तारीख या संस्करण रखें और आउटपुट का स्रोत से संबंध बचाएं। विश्लेषण में इस्तेमाल होने वाले डेटा के लिए यह विशेष रूप से जरूरी है।

जल्दी फैसला करने का क्रम

  1. क्या टेक्स्ट चुना जा सकता है?
  2. क्या एक वाक्य सही कॉपी होता है?
  3. क्या तालिका, कॉलम और सूत्र की संरचना सही है?
  4. क्या अलग पृष्ठों की स्थिति अलग है?
  5. आपको Excel, Word, Markdown या JSON में से क्या चाहिए?

इन सवालों से चित्र में अक्षर पहचान, टेक्स्ट परत की पुनर्प्राप्ति और लेआउट पुनर्रचना को अलग किया जा सकता है तथा अनावश्यक OCR से बचा जा सकता है।

PDFIntact की मुफ्त जांच ब्राउज़र में मूल फ़ाइल अपलोड किए बिना पृष्ठों की संख्या, टेक्स्ट लेयर की स्थिति और पहचानी गई तालिकाओं व चित्रों की संख्या बताती है। यह निकाले गए टेक्स्ट का प्रीव्यू या पढ़ने के क्रम और तालिका संरचना की पुष्टि नहीं करती। कन्वर्ज़न का तरीका चुनने और आउटपुट जांचने की जिम्मेदारी अलग रहती है।

अपलोड किए बिना जांचें

पहले देखें कि इस PDF से क्या निकाला जा सकता है

मुफ्त जांच आपके ब्राउज़र में चलती है। आपकी मूल फ़ाइल अपलोड नहीं होती।

कॉपी न होने वाली PDF की मुफ्त जांच करें