| 36 | return str(content) |
| 37 | |
| 38 | class PDFReader(Reader): |
| 39 | def parse(self, file_path: Path) -> str: |
| 40 | logger.info(f"Reading PDF file from {file_path}.") |
| 41 | content = PyPDF2.PdfReader(file_path) |
| 42 | text = "" |
| 43 | for page_idx in range(len(content.pages)): |
| 44 | text += f'Page {page_idx + 1}\n' + content.pages[page_idx].extract_text() |
| 45 | return text |
| 46 | |
| 47 | class DOCXReader(Reader): |
| 48 | def parse(self, file_path: Path) -> str: |