Files
doczyai-pipelines/src/test.py
T
2024-09-26 18:53:57 +01:00

45 lines
1.1 KiB
Python

import pandas as pd
import re
import json
import csv
from io import StringIO
import config
import ast
import os
import utils
import postprocess
import postprocessingfuncs
import preprocess
import table_funcs
import prompts
import prompt_funcs
import claude_funcs
# all_dfs = []
# for file in os.listdir('output'):
# if 'combined_results_post_processed.csv' in os.listdir(os.path.join('output', file)):
# try:
# df = pd.read_csv(f'output/{file}/combined_results_post_processed.csv')
# all_dfs.append(df)
# except:
# continue
# final_df = pd.concat(all_dfs, ignore_index=True)
# final_df.to_excel('output_consolidated/test_20240610_batch1.xlsx')
input_dict = utils.read_input()
(filename, contract_text) = list(input_dict.items())[0]
contract_text = preprocess.clean_newlines(contract_text)
text_dict = preprocess.split_text(contract_text)
text_dict = table_funcs.align_and_format_tables(text_dict)
text_dict = preprocess.highlight_rates(text_dict)
bu_results = prompt_funcs.run_bottom_up_primary({'5' : text_dict['5']}, 4000) # Returns list of dictionaries
print(bu_results)