81e7223560
Text Extraction * bases * go * splitting * structure * movetoasync * movetoasync * settinguptrigger * reorder * storevent * standardisepollingvalidation * unittests * fixlint * fixlint * awscfg * generatesample * followthrough * tests * clena * store * externalidcleanup * clientid * local * baseunittests * putobjecttests * tests
160 lines
4.3 KiB
Go
160 lines
4.3 KiB
Go
package repository_test
|
|
|
|
import (
|
|
"context"
|
|
"testing"
|
|
|
|
"queryorchestration/internal/database/repository"
|
|
"queryorchestration/internal/serviceconfig"
|
|
"queryorchestration/internal/test"
|
|
|
|
"github.com/google/uuid"
|
|
"github.com/stretchr/testify/assert"
|
|
"github.com/stretchr/testify/require"
|
|
)
|
|
|
|
func TestTextExtraction(t *testing.T) {
|
|
if testing.Short() {
|
|
t.Skip("Skipping long test in short mode")
|
|
}
|
|
ctx := context.Background()
|
|
|
|
cfg := &serviceconfig.BaseConfig{}
|
|
test.SetCfgProvider(t, cfg)
|
|
_, textup := test.CreateDB(t, ctx, cfg, &test.CreateDatabaseConfig{
|
|
RunMigrations: true,
|
|
})
|
|
defer textup()
|
|
|
|
queries := cfg.GetDBQueries()
|
|
|
|
clientId := "EXAMPLE"
|
|
err := queries.CreateClient(ctx, &repository.CreateClientParams{
|
|
Name: "example_client",
|
|
ID: clientId,
|
|
})
|
|
require.NoError(t, err)
|
|
|
|
hash := "example_hash"
|
|
id, err := queries.CreateDocument(ctx, &repository.CreateDocumentParams{
|
|
Clientid: clientId,
|
|
Hash: hash,
|
|
})
|
|
require.NoError(t, err)
|
|
assert.NotEmpty(t, id)
|
|
|
|
bucket := "example_bucket"
|
|
key := "example_key"
|
|
cleanid, err := queries.AddDocumentClean(ctx, &repository.AddDocumentCleanParams{
|
|
Documentid: id,
|
|
Bucket: &bucket,
|
|
Key: &key,
|
|
Hash: &hash,
|
|
Mimetype: repository.NullCleanmimetype{
|
|
Valid: true,
|
|
Cleanmimetype: repository.CleanmimetypeApplicationPdf,
|
|
},
|
|
})
|
|
require.NoError(t, err)
|
|
err = queries.AddDocumentCleanEntry(ctx, &repository.AddDocumentCleanEntryParams{
|
|
Cleanid: cleanid,
|
|
Version: 1,
|
|
})
|
|
require.NoError(t, err)
|
|
|
|
isextract, err := queries.IsDocumentTextExtracted(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.False(t, isextract)
|
|
|
|
triggerId, err := queries.AddDocumentTextTrigger(ctx, &repository.AddDocumentTextTriggerParams{
|
|
Cleanid: cleanid,
|
|
Version: 123,
|
|
})
|
|
require.NoError(t, err)
|
|
|
|
trigger, err := queries.GetDocumentTextTrigger(ctx, triggerId)
|
|
require.NoError(t, err)
|
|
assert.EqualExportedValues(t, &repository.GetDocumentTextTriggerRow{
|
|
ID: triggerId,
|
|
Cleanid: cleanid,
|
|
Version: 123,
|
|
Documentid: id,
|
|
}, trigger)
|
|
|
|
isextract, err = queries.IsDocumentTextExtracted(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.False(t, isextract)
|
|
|
|
textractId := "hello"
|
|
err = queries.AddDocumentTextTriggerJobId(ctx, &repository.AddDocumentTextTriggerJobIdParams{
|
|
Textractjobid: &textractId,
|
|
ID: triggerId,
|
|
})
|
|
require.NoError(t, err)
|
|
|
|
trigger, err = queries.GetDocumentTextTrigger(ctx, triggerId)
|
|
require.NoError(t, err)
|
|
assert.EqualExportedValues(t, &repository.GetDocumentTextTriggerRow{
|
|
ID: triggerId,
|
|
Cleanid: cleanid,
|
|
Version: 123,
|
|
Textractjobid: &textractId,
|
|
Documentid: id,
|
|
}, trigger)
|
|
|
|
isextract, err = queries.IsDocumentTextExtracted(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.False(t, isextract)
|
|
|
|
textId, err := queries.AddDocumentText(ctx, &repository.AddDocumentTextParams{
|
|
Bucket: bucket,
|
|
Key: key,
|
|
Hash: "example",
|
|
})
|
|
require.NoError(t, err)
|
|
assert.NotNil(t, textId)
|
|
assert.NotEqual(t, uuid.UUID{}, textId)
|
|
|
|
isextract, err = queries.IsDocumentTextExtracted(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.False(t, isextract)
|
|
|
|
err = queries.AddDocumentTextEntry(ctx, &repository.AddDocumentTextEntryParams{
|
|
Textid: textId,
|
|
Triggerid: triggerId,
|
|
Version: 543,
|
|
})
|
|
require.NoError(t, err)
|
|
|
|
isextract, err = queries.IsDocumentTextExtracted(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.True(t, isextract)
|
|
|
|
text, err := queries.GetTextEntryByDocId(ctx, id)
|
|
require.NoError(t, err)
|
|
assert.Equal(t, textId, text.ID)
|
|
assert.Equal(t, id, text.Documentid)
|
|
assert.Equal(t, bucket, text.Bucket)
|
|
assert.Equal(t, key, text.Key)
|
|
assert.Equal(t, "example", text.Hash)
|
|
assert.Equal(t, cleanid, text.Cleanid)
|
|
assert.Equal(t, triggerId, text.Triggerid)
|
|
assert.Equal(t, textractId, *text.Textractjobid)
|
|
assert.Equal(t, int64(123), text.Triggerversion)
|
|
assert.Equal(t, int64(543), text.Extractionversion)
|
|
assert.Equal(t, textId, text.ID)
|
|
|
|
uniqueEntry, err := queries.GetDocumentTextExtractionByHash(ctx, &repository.GetDocumentTextExtractionByHashParams{
|
|
Hash: "example",
|
|
Cleanentryid: cleanid,
|
|
})
|
|
require.NoError(t, err)
|
|
assert.EqualExportedValues(t, text.ID, uniqueEntry)
|
|
|
|
_, err = queries.GetDocumentTextExtractionByHash(ctx, &repository.GetDocumentTextExtractionByHashParams{
|
|
Hash: "definitely invalid",
|
|
Cleanentryid: cleanid,
|
|
})
|
|
require.EqualError(t, err, "no rows in result set")
|
|
}
|