From d447006548ba268bd89b31e368c17798551bb01b Mon Sep 17 00:00:00 2001 From: Mayank Aamseek Date: Tue, 16 Apr 2024 15:31:32 +0530 Subject: [PATCH] post processing for contract_num added --- .gitignore | 4 ++-- streamlit/interface_3.py | 12 +++++++++++- 2 files changed, 13 insertions(+), 3 deletions(-) diff --git a/.gitignore b/.gitignore index 0367060..da68c9a 100644 --- a/.gitignore +++ b/.gitignore @@ -55,11 +55,11 @@ streamlit/DB/ streamlit/RAW_DOCUMENTS/ streamlit/SOURCE_DOCUMENTS/ streamlit/contract_field_values.csv -# streamlit/contract_fields.csv +streamlit/contract_fields.csv streamlit/sample.csv streamlit/temp1.csv streamlit/temp2.csv -# streamlit/results.csv +streamlit/results.csv # env streamlit/venv diff --git a/streamlit/interface_3.py b/streamlit/interface_3.py index ce6d51b..4f605d6 100644 --- a/streamlit/interface_3.py +++ b/streamlit/interface_3.py @@ -523,6 +523,11 @@ if st.session_state.user_info['mail'] in user_list: answer_list = [answer if str(answer) != "one year" else "1 year" for answer in answer_list] answer_list = [answer if str(answer) != "one" else "1 year" for answer in answer_list] answer_list = [answer if str(answer) != "one (1) year" else "1 year" for answer in answer_list] + answer_list = [answer if str(answer) != "twelve" else "1 year" for answer in answer_list] + answer_list = [answer if str(answer) != "XI" else "11" for answer in answer_list] + answer_list = [answer if str(answer) != "Third" else "3" for answer in answer_list] + answer_list = [answer if str(answer) != "Six" else "6" for answer in answer_list] + answer_list = [answer.rstrip(".") for answer in answer_list] else: answer_list = [answer.rstrip(".") for answer in answer_list] @@ -564,7 +569,8 @@ if st.session_state.user_info['mail'] in user_list: field_values_1['Contract Name'] = document_name field_values_2 = pd.concat([field_values_2, field_values_1], ignore_index = True) - df = pd.merge(df, field_values_2, how ='left', on =['Contract Name', 'SF_DB_COL_NAME']) + df = pd.merge(df, field_values_2, how ='right', on =['Contract Name', 'SF_DB_COL_NAME']) + df = df.drop_duplicates(subset=['SF_DB_COL_NAME', 'Contract Name'], keep="first") df['Original Page Number'] = df['Original Page Number'].apply(lambda x: re.search(r'\d+', x).group( ) if isinstance(x, str) and re.search(r'\d+', x) is not None else " ") @@ -581,6 +587,10 @@ if st.session_state.user_info['mail'] in user_list: df['Actual Value Stored'] = df['Actual Value Stored'].apply(lambda x: x.strip() if isinstance(x, str) else '') df['New Extracted value'] = df['New Extracted value'].apply(lambda x: x.strip() if isinstance(x, str) else '') actual_value_list = list(df['Actual Value Stored']) + actual_value_list = [answer if str(answer) != "12 months" else "1 year" for answer in actual_value_list] + actual_value_list = [answer if str(answer) != "Fifth" else "5" for answer in actual_value_list] + actual_value_list = [answer if str(answer) != "Seventh" else "7" for answer in actual_value_list] + answer_list = list(df['New Extracted value']) actual_value_list = [s.replace('-', '').replace(' ', '').replace('[', '').replace(']', '').lower() for s in actual_value_list] answer_list = [s.replace('-', '').replace(' ', '').replace('[', '').replace(']', '').lower() for s in answer_list]