PDF 到 文字
從 PDF 提取可選文字到 TXT
NetroDoc 讀取 PDF 的現有文字層,並將已提取的頁面文字寫入平原 TXT 檔案。
輸出為 UTF-8 文字。 此工具不執行 OCR因此,沒有文字層的只掃描影象頁面可能返回很少或沒有文字。
投入PDF 不超過 100 MB
頁數限制長達2 000頁
產出UTF-8 導彈 TXT
方法已存在的 PDF 文字層
如何將 PDF 轉換為 TXT
1
上傳檔案
選擇相容檔案或將其降入 NetroDoc 工作空間。
2
選擇 PDF 到 TXT
啟動所選檔案顯示的轉換動作 。
3
下載結果
NetroDoc 建立已轉換的檔案並開始下載。
PDF 期間發生的情況 TXT 轉換?
文字按文件順序從PDF頁面文字層中取出,並在頁面之間插入空白行.
TXT 不保留視覺佈局、字型、影象、向量圖形、窗體控制元件或PDF頁面設計。
複雜的列、表、頁首、頁尾或讀取順序可能無法完美地對映到純文字。掃描的頁面需要 OCR,該工具目前未執行。
這種轉換什麼時候有用?
複製文件文字
將可選擇的 PDF 文字移動到一個輕量級檔案,該檔案易於搜尋、複製和編輯。
說明和起草
使用沒有原始頁面佈局的措辭。
文字處理
UTF-8 導彈 TXT 與文字編輯器、指令碼和索引工作流程合作良好。
刪除視覺複雜性
保留書面內容,同時保留頁面圖形和格式。
臨時檔案處理
上傳檔案在您的臨時工作目錄中處理 NetroDoc 伺服器。當前轉換管道不會故意將上傳的檔案傳送到第三方轉換服務或雲 API。
臨時工作目錄在回覆傳送後被刪除,在驗證或轉換失敗時也被刪除,不需要賬戶.
隱私 →PDF 改為 TXT 財務問題
此工具是否使用 OCR?
號。 它提取現有的 PDF 文字層而不執行 OCR.
使用什麼編碼?
密碼 TXT 輸出為 UTF- 8 。
可以處理多少頁?
每個取出文字的轉換最多可有2000個PDF頁.
為什麼缺少格式?
TXT 是純文字,所以PDF版式,字型,影象,列,以及其他可視格式沒有被保留.
是否支援密碼保護的 PDF ?
目前沒有。 PDF 必須先解鎖 。