fix: skip unreadable PDFs during metadata extraction

This commit is contained in:
2026-08-10 23:58:42 -04:00
parent 1415cb6244
commit 3091cc879d
@@ -155,7 +155,11 @@ class PdfExtractor(FileExtractor):
if isinstance(data, UploadFile): if isinstance(data, UploadFile):
data = data.file data = data.file
try:
doc = pypdfium2.PdfDocument(data) doc = pypdfium2.PdfDocument(data)
except Exception as e:
logger.error(f"Error extracting metadata from pdf: {e}")
return {}
basic_metadata = doc.get_metadata_dict(skip_empty=False) basic_metadata = doc.get_metadata_dict(skip_empty=False)
metadata["title"] = basic_metadata["Title"] metadata["title"] = basic_metadata["Title"]