PDF से टेक्स्ट निकालें

PDF का मौजूदा पाठ निकालें या अंग्रेज़ी, स्पेनिश और सरलीकृत चीनी के मुद्रित स्कैन व चित्रों के लिए स्थानीय OCR चुनें।

जब यह उपकरण उपयोगी होता है

डिज़िटल रूप से बनाई गई रिपोर्ट, लेख, चालान, और नोट्स से पठनीय टेक्स्ट कॉपी करना, खोज या संपादन के लिए।

स्थानीय प्रोसेसिंग कैसे काम करती है

बुनियादी निष्कर्षण: ब्राउज़र प्रत्येक पेज के टेक्स्ट आइटम पढ़ता है, उन्हें अनुमानित पढ़ने के क्रम में जोड़ता है, पेज अलग करता है, और UTF-8 सादा टेक्स्ट डाउनलोड बनाता है। दस्तावेज़ ब्राउज़र की मेमोरी में रहता है। OCR कोड और चुनी भाषा का मॉडल इसी साइट से डाउनलोड होते हैं; यह फ़ाइल अपलोड नहीं है। पृष्ठ छोड़ने या साफ़ करने पर दस्तावेज़ और परिणाम हटा दिए जाते हैं। ये पृष्ठ बिना OCR कॉपी होंगे। यदि स्कैन में केवल शीर्षक टेक्स्ट है और शेष को पहचानना है तो इसे बंद करें।

इसे कैसे उपयोग करें

  1. स्रोत तैयार करें: डिज़िटल रूप से बनाई गई रिपोर्ट, लेख, चालान, और नोट्स से पठनीय टेक्स्ट कॉपी करना, खोज या संपादन के लिए।
  2. स्थानीय रूप से प्रक्रिया करें: बुनियादी निष्कर्षण: ब्राउज़र प्रत्येक पेज के टेक्स्ट आइटम पढ़ता है, उन्हें अनुमानित पढ़ने के क्रम में जोड़ता है, पेज अलग करता है, और UTF-8 सादा टेक्स्ट डाउनलोड बनाता है। दस्तावेज़ ब्राउज़र की मेमोरी में रहता है। OCR कोड और चुनी भाषा का मॉडल इसी साइट से डाउनलोड होते हैं; यह फ़ाइल अपलोड नहीं है। पृष्ठ छोड़ने या साफ़ करने पर दस्तावेज़ और परिणाम हटा दिए जाते हैं। ये पृष्ठ बिना OCR कॉपी होंगे। यदि स्कैन में केवल शीर्षक टेक्स्ट है और शेष को पहचानना है तो इसे बंद करें।
  3. डाउनलोड करें और पुष्टि करें: इस्तेमाल से पहले पहचाना गया टेक्स्ट और PDF मूल से मिलाएँ। विश्वास स्कोर अनुमान है, सटीकता की गारंटी नहीं।

महत्वपूर्ण सीमाएँ

केवल मुद्रित पाठ के लिए। OCR अक्षर गलत पढ़ सकता है और संपादन योग्य लेआउट, तालिका या लिखावट नहीं बनाता। OCR पृष्ठ अदृश्य टेक्स्ट परत वाले चित्र बनते हैं; उन पृष्ठों के लिंक, फ़ॉर्म, टिप्पणियाँ और हस्ताक्षर नहीं बचते। यह PDF/A प्रमाणन नहीं है।

डाउनलोड किए गए परिणाम की पुष्टि करें

इस्तेमाल से पहले पहचाना गया टेक्स्ट और PDF मूल से मिलाएँ। विश्वास स्कोर अनुमान है, सटीकता की गारंटी नहीं।

डिजाइन द्वारा निजी

आपकी फ़ाइलें इस ब्राउज़र में रहती हैं। टूल स्रोत या आउटपुट को हमारे सर्वर पर अपलोड नहीं करता।

प्रश्न और उत्तर

यह उपकरण कब उपयोगी है?

डिज़िटल रूप से बनाई गई रिपोर्ट, लेख, चालान, और नोट्स से पठनीय टेक्स्ट कॉपी करना, खोज या संपादन के लिए।

ब्राउज़र वास्तव में क्या करता है?

बुनियादी निष्कर्षण: ब्राउज़र प्रत्येक पेज के टेक्स्ट आइटम पढ़ता है, उन्हें अनुमानित पढ़ने के क्रम में जोड़ता है, पेज अलग करता है, और UTF-8 सादा टेक्स्ट डाउनलोड बनाता है। दस्तावेज़ ब्राउज़र की मेमोरी में रहता है। OCR कोड और चुनी भाषा का मॉडल इसी साइट से डाउनलोड होते हैं; यह फ़ाइल अपलोड नहीं है। पृष्ठ छोड़ने या साफ़ करने पर दस्तावेज़ और परिणाम हटा दिए जाते हैं। ये पृष्ठ बिना OCR कॉपी होंगे। यदि स्कैन में केवल शीर्षक टेक्स्ट है और शेष को पहचानना है तो इसे बंद करें।

कौन सी सीमाओं को मुझे समझना चाहिए?

केवल मुद्रित पाठ के लिए। OCR अक्षर गलत पढ़ सकता है और संपादन योग्य लेआउट, तालिका या लिखावट नहीं बनाता। OCR पृष्ठ अदृश्य टेक्स्ट परत वाले चित्र बनते हैं; उन पृष्ठों के लिंक, फ़ॉर्म, टिप्पणियाँ और हस्ताक्षर नहीं बचते। यह PDF/A प्रमाणन नहीं है।

मुझे परिणाम की पुष्टि कैसे करनी चाहिए?

इस्तेमाल से पहले पहचाना गया टेक्स्ट और PDF मूल से मिलाएँ। विश्वास स्कोर अनुमान है, सटीकता की गारंटी नहीं।

संबंधित उपकरण