infobim-doc

Referência de FSM — context

Máquinas de estado finito declaradas por context em infobim.

Nome Descrição
DictionaryInspection Statechart for generic semantic dictionary inspection of arbitrary text.
FileMeaningSuggestion Statechart for semantic file meaning suggestions derived from paths.
PdfToGraph Statechart for transforming PDF documents into knowledge graph inputs.

DictionaryInspection { #fsm-dictionaryinspection }

Descrição

Statechart for generic semantic dictionary inspection of arbitrary text.

Estados

Indefinido

__undefined__

Estado inicial antes da normalizacao do texto de entrada.

↓

Texto Normalizado

__text_normalized__

O texto de entrada possui uma representacao normalizada deterministica.

Capability: src/ontobdc/context/plugin/capability/transformation/text_normalized.py

↓

Idioma do Texto Identificado

__text_language_identified__

O idioma do texto normalizado foi identificado.

Capability: src/ontobdc/context/plugin/capability/transformation/text_language_identified.py

↓

Texto Lematizado

__text_lemmatized__

O texto normalizado foi reduzido a lemas dependentes do idioma.

Capability: src/ontobdc/context/plugin/capability/transformation/text_lemmatized.py

↓

Termo da Ontologia Resolvido

__ontology_term_resolved__

O texto lematizado foi resolvido contra o dicionario de ontologias por correspondencia exata ou fuzzy.

Capability: src/ontobdc/context/plugin/capability/transformation/ontology_term_resolved.py

↓

Representacao do Tipo Resolvida

__kind_representation_resolved__

As representacoes declaradas para cada termo resolvido foram obtidas.

Capability: src/ontobdc/context/plugin/capability/transformation/kind_representation_resolved.py

↓

Markdown Renderizado final

__markdown_rendered__

O resultado da inspecao do dicionario foi renderizado e persistido como arquivo de estado ETL Markdown.

Capability: src/ontobdc/context/plugin/capability/persister/dictionary_inspection_markdown_rendered.py

FileMeaningSuggestion { #fsm-filemeaningsuggestion }

Descrição

Statechart for semantic file meaning suggestions derived from paths.

Estados

Indefinido

__undefined__

Estado inicial antes da normalizacao do caminho do arquivo de origem.

↓

Caminho Normalizado

__path_normalized__

O caminho de origem possui uma representacao normalizada pronta para identificacao de idioma.

↓

Idioma do Caminho Identificado

__path_language_identified__

O idioma do caminho normalizado foi identificado para lematizacao.

↓

Metadados do Arquivo Extraidos

__file_metadata_extracted__

Os metadados relevantes para correspondencia semantica foram extraidos do caminho normalizado do arquivo.

↓

Caminho Lematizado

__path_lemmatized__

O caminho normalizado foi reduzido ao seu lema, pronto para estatisticas de corpus em nivel de token.

↓

Estatisticas de Token Computadas

__token_statistics_computed__

Estatisticas deterministicas de corpus em nivel de token foram computadas a partir de cada caminho lematizado.

↓

Candidatos a Chunk Gerados

__chunk_candidates_generated__

Expressoes contiguas de multiplos tokens foram geradas como candidatos a chunk com evidencias rastreaveis do corpus.

↓

Chunks Extraidos

__chunks_extracted__

Os candidatos a chunk com suporte estatistico foram promovidos a chunks aceitos de forma deterministica.

↓

Termos da Ontologia Correspondidos

__ontology_terms_matched__

Os chunks aceitos foram comparados com termos explicitamente declarados na ontologia.

↓

Candidatos de Categoria Encontrados final

__category_candidates_found__

Candidatos de categoria hierarquicos agrupados por arquivo do ro-crate, depois por categoria da ontologia, depois por chunk. Exato=1.0, fuzzy=min/comprimento/max(comprimento) por substring, nao-match=0 em bucket sintetico.

PdfToGraph { #fsm-pdftograph }

Descrição

Statechart for transforming PDF documents into knowledge graph inputs.

Estados

Indefinido

__undefined__

Estado inicial antes do pipeline PDF-para-grafo começar.

↓

Legibilidade de Texto do PDF Verificada

__text_readiness_checked__

O PDF foi verificado e contém texto plano extraível suficiente para autoria de grafo de conhecimento.

Capability: src/ontobdc/context/plugin/capability/transformation/text_readiness.py

↓

Blocos de Texto do PDF Extraídos final

__pdf_blocks_extracted__

Blocos de texto posicionados foram extraídos de cada página do PDF com PyMuPDF.

Capability: src/ontobdc/context/plugin/capability/transformation/pdf_block.py