如何使用pdf.js从pdf中正确提取文本

Question

我是ES6和Promise的新手。我正在尝试pdf.js将pdf文件的所有页面中的文本提取到字符串数组中。提取完成后，我想以某种方式解析数组。说pdf文件（通过typedarray正确传递）有4页面，我的代码是：

let str = [];
PDFJS.getDocument(typedarray).then(function(pdf) {
  for(let i = 1; i <= pdf.numPages; i++) {
    pdf.getPage(i).then(function(page) {
      page.getTextContent().then(function(textContent) {
        for(let j = 0; j < textContent.items.length; j++) {
          str.push(textContent.items[j].str);
        }
        parse(str);
      });
    });
  }
});

它设法工作，但是，当然，问题是我的parse功能被称为4次。我只想在完成所有4页提取后才调用parse。欢迎任何建议。请点亮我。

Answer 1

与https://stackoverflow.com/a/40494019/1765767类似 - 使用Promise.all收集页面承诺，不要忘记链接然后：

function gettext(pdfUrl){
var pdf = PDFJS.getDocument(pdfUrl);
return pdf.then(function(pdf) { // get all pages text
     var maxPages = pdf.pdfInfo.numPages;
     var countPromises = []; // collecting all page promises
     for (var j = 1; j <= maxPages; j++) {
        var page = pdf.getPage(j);

        var txt = "";
        countPromises.push(page.then(function(page) { // add page promise
            var textContent = page.getTextContent();
            return textContent.then(function(text){ // return content promise
                return text.items.map(function (s) { return s.str; }).join(''); // value page text 

            });
        }));
     }
     // Wait for all pages and join text
     return Promise.all(countPromises).then(function (texts) {
       
       return texts.join('');
     });
});
}
// waiting on gettext to finish completion, or error
gettext("https://cdn.mozilla.net/pdfjs/tracemonkey.pdf").then(function (text) {
  alert('parse ' + text);
}, function (reason) {
  console.error(reason);
});

<script src="https://npmcdn.com/pdfjs-dist/build/pdf.js"></script>

Answer 2

更简洁的@async5版本，并根据最新版本的"pdfjs-dist": "^2.0.943"进行了更新


import PDFJS from "pdfjs-dist";

PDFJS.disableTextLayer = true;
PDFJS.disableWorker = true;

const getPageText = async (pdf: Pdf, pageNo: number) => {
  const page = await pdf.getPage(pageNo);
  const tokenizedText = await page.getTextContent();
  const pageText = tokenizedText.items.map(token => token.str).join("");
  return pageText;
};

export const getPDFText = async (source: PDFSource): Promise<string> => {
  const pdf: Pdf = await PDFJS.getDocument(source).promise;
  const maxPages = pdf.numPages;
  const pageTextPromises = [];
  for (let pageNo = 1; pageNo <= maxPages; pageNo += 1) {
    pageTextPromises.push(getPageText(pdf, pageNo));
  }
  const pageTexts = await Promise.all(pageTextPromises);
  return pageTexts.join(" ");
};

这是我在任何人需要时使用的相应打字稿声明文件。

declare module "pdfjs-dist";

type TokenText = {
  str: string;
};
type PageText = {
  items: TokenText[];
};
type PdfPage = {
  getTextContent: () => Promise<PageText>;
};
type Pdf = {
  numPages: number;
  getPage: (pageNo: number) => Promise<PdfPage>;
};

type PDFSource = Buffer | string;

如何使用pdf.js从pdf中正确提取文本

问题描述投票：3回答：2

2个回答

最新问题

如何使用pdf.js从pdf中正确提取文本

问题描述 投票：3回答：2

2个回答

最新问题

问题描述投票：3回答：2