Files
query-orchestration/internal/document/text/extract_test.go
T
Jay Brown 0ddae4f91e Merged in feature/remove-query (pull request #201)
remove query from codebase part 1

* remove query

* fix localstack run
2026-01-14 17:59:04 +00:00

115 lines
3.3 KiB
Go

package documenttext
import (
"io"
"strings"
"testing"
"time"
"queryorchestration/internal/database/repository"
"queryorchestration/internal/serviceconfig"
"queryorchestration/internal/serviceconfig/aws"
"queryorchestration/internal/serviceconfig/objectstore"
"queryorchestration/internal/serviceconfig/textract"
objectstoremock "queryorchestration/mocks/objectstore"
textractmock "queryorchestration/mocks/textract"
"github.com/aws/aws-sdk-go-v2/service/s3"
"github.com/google/uuid"
"github.com/pashagolub/pgxmock/v3"
"github.com/stretchr/testify/mock"
"github.com/stretchr/testify/require"
)
type DocTextConfig struct {
aws.AWSConfig
serviceconfig.BaseConfig
textract.TextractConfig
objectstore.ObjectStoreConfig
}
func TestCreate(t *testing.T) {
ctx := t.Context()
pool, err := pgxmock.NewPool()
require.NoError(t, err)
cfg := &DocTextConfig{}
cfg.DBPool = pool
cfg.DBQueries = repository.New(pool)
mockStore := objectstoremock.NewMockS3Client(t)
cfg.StoreClient = mockStore
mockTextract := textractmock.NewMockTextractClient(t)
cfg.TextractClient = mockTextract
svc := Service{
cfg: cfg,
}
docId := uuid.New()
t.Run("is not extracted", func(t *testing.T) {
cleanId := uuid.New()
bucket := "bucket"
// Hash will be different with PDF vs PNG processing - use actual computed hash
// We'll capture the computed hash and use it in expectations
hash := `"computed-during-test"`
textId := uuid.New()
key := objectstore.BucketKey{
ClientID: "aa",
Location: objectstore.Import,
CreatedAt: time.Now().UTC(),
EntityID: cleanId,
}
keyStr := key.String()
textractBaseOut, pdf, _, close := getFiles(t, "helloWorld")
defer close()
mimetype := repository.NullCleanmimetype{
Valid: true,
Cleanmimetype: repository.CleanmimetypeApplicationPdf,
}
pool.ExpectQuery("name: IsDocumentTextExtracted :one").WithArgs(docId).WillReturnRows(
pgxmock.NewRows([]string{"isextracted"}).
AddRow(false),
)
pool.ExpectQuery("name: GetCleanEntryByDocId :one").WithArgs(docId).
WillReturnRows(
pgxmock.NewRows([]string{"id", "documentId", "bucket", "key", "version", "hash", "mimetype", "fail", "clientId"}).
AddRow(cleanId, docId, &bucket, &keyStr, int64(123), &hash, mimetype, nil, key.ClientID),
)
bodyMsg := io.NopCloser(strings.NewReader(pdfHelloWorld))
mockStore.EXPECT().
GetObject(
mock.Anything,
mock.MatchedBy(func(in *s3.GetObjectInput) bool {
return *in.Bucket == bucket && *in.Key == keyStr
}),
mock.Anything,
).
Return(&s3.GetObjectOutput{
Body: bodyMsg,
}, nil)
textExpectations(t, ctx, mockTextract, pdf, textractBaseOut)
pool.ExpectBegin()
pool.ExpectQuery("name: GetDocumentTextExtractionByHash :one").WithArgs(cleanId, pgxmock.AnyArg()).WillReturnRows(
pgxmock.NewRows([]string{"id"}).
AddRow(textId),
)
pool.ExpectExec("name: AddDocumentTextEntry :exec").WithArgs(textId, pgxmock.AnyArg()).
WillReturnResult(pgxmock.NewResult("", 1))
pool.ExpectCommit()
err = svc.Extract(ctx, docId)
require.NoError(t, err)
})
t.Run("is extracted", func(t *testing.T) {
pool.ExpectQuery("name: IsDocumentTextExtracted :one").WithArgs(docId).WillReturnRows(
pgxmock.NewRows([]string{"isextracted"}).
AddRow(true),
)
err = svc.Extract(ctx, docId)
require.NoError(t, err)
})
}