diff --git a/fieldExtraction/src/investment/vision_funcs.py b/fieldExtraction/src/investment/vision_funcs.py index 9b53cee..d9caf4d 100644 --- a/fieldExtraction/src/investment/vision_funcs.py +++ b/fieldExtraction/src/investment/vision_funcs.py @@ -11,7 +11,7 @@ import src.utils.string_utils as string_utils def get_image_array_based_answer( pdf_path: str, - effective_date_page_numbers: List[int], + effective_date_page_numbers: List, filename: str, fields: List[str] = ["AARETE_DERIVED_EFFECTIVE_DT"] ) -> dict: @@ -41,7 +41,7 @@ def get_image_array_based_answer( return response_dict -def process_pdf_pages_to_base64_images(pdf_path: str, filename: str, page_numbers: List[int]) -> List[str]: +def process_pdf_pages_to_base64_images(pdf_path: str, filename: str, page_numbers: List) -> List[str]: """ Convert multiple specific pages of a PDF into a list of base64-encoded JPEG images. diff --git a/fieldExtraction/src/utils/string_utils.py b/fieldExtraction/src/utils/string_utils.py index 236184a..2299d67 100644 --- a/fieldExtraction/src/utils/string_utils.py +++ b/fieldExtraction/src/utils/string_utils.py @@ -472,7 +472,7 @@ def extract_effective_date_pages(text_dict: dict, filename: str) -> dict: if textract_pattern.search(page_text) or 'effective date:' in page_text.lower(): effective_date_pages[page_num] = page_text # Always include the first page (page 1) as it often contains effective date. - elif page_num == 1: + elif page_num == 1 or page_num == "1" or page_num == "1.0": effective_date_pages[page_num] = page_text return effective_date_pages