Máquinas de estado finito declaradas por context em infobim.
| Nome | Descrição |
|---|---|
DictionaryInspection |
Statechart for generic semantic dictionary inspection of arbitrary text. |
FileMeaningSuggestion |
Statechart for semantic file meaning suggestions derived from paths. |
PdfToGraph |
Statechart for transforming PDF documents into knowledge graph inputs. |
DictionaryInspection { #fsm-dictionaryinspection }Statechart for generic semantic dictionary inspection of arbitrary text.
Indefinido
__undefined__
Estado inicial antes da normalizacao do texto de entrada.
↓
Texto Normalizado
__text_normalized__
O texto de entrada possui uma representacao normalizada deterministica.
Capability: src/ontobdc/context/plugin/capability/transformation/text_normalized.py
↓
Idioma do Texto Identificado
__text_language_identified__
O idioma do texto normalizado foi identificado.
Capability: src/ontobdc/context/plugin/capability/transformation/text_language_identified.py
↓
Texto Lematizado
__text_lemmatized__
O texto normalizado foi reduzido a lemas dependentes do idioma.
Capability: src/ontobdc/context/plugin/capability/transformation/text_lemmatized.py
↓
Termo da Ontologia Resolvido
__ontology_term_resolved__
O texto lematizado foi resolvido contra o dicionario de ontologias por correspondencia exata ou fuzzy.
Capability: src/ontobdc/context/plugin/capability/transformation/ontology_term_resolved.py
↓
Representacao do Tipo Resolvida
__kind_representation_resolved__
As representacoes declaradas para cada termo resolvido foram obtidas.
Capability: src/ontobdc/context/plugin/capability/transformation/kind_representation_resolved.py
↓
Markdown Renderizado final
__markdown_rendered__
O resultado da inspecao do dicionario foi renderizado e persistido como arquivo de estado ETL Markdown.
Capability: src/ontobdc/context/plugin/capability/persister/dictionary_inspection_markdown_rendered.py
FileMeaningSuggestion { #fsm-filemeaningsuggestion }Statechart for semantic file meaning suggestions derived from paths.
Indefinido
__undefined__
Estado inicial antes da normalizacao do caminho do arquivo de origem.
↓
Caminho Normalizado
__path_normalized__
O caminho de origem possui uma representacao normalizada pronta para identificacao de idioma.
↓
Idioma do Caminho Identificado
__path_language_identified__
O idioma do caminho normalizado foi identificado para lematizacao.
↓
Metadados do Arquivo Extraidos
__file_metadata_extracted__
Os metadados relevantes para correspondencia semantica foram extraidos do caminho normalizado do arquivo.
↓
Caminho Lematizado
__path_lemmatized__
O caminho normalizado foi reduzido ao seu lema, pronto para estatisticas de corpus em nivel de token.
↓
Estatisticas de Token Computadas
__token_statistics_computed__
Estatisticas deterministicas de corpus em nivel de token foram computadas a partir de cada caminho lematizado.
↓
Candidatos a Chunk Gerados
__chunk_candidates_generated__
Expressoes contiguas de multiplos tokens foram geradas como candidatos a chunk com evidencias rastreaveis do corpus.
↓
Chunks Extraidos
__chunks_extracted__
Os candidatos a chunk com suporte estatistico foram promovidos a chunks aceitos de forma deterministica.
↓
Termos da Ontologia Correspondidos
__ontology_terms_matched__
Os chunks aceitos foram comparados com termos explicitamente declarados na ontologia.
↓
Candidatos de Categoria Encontrados final
__category_candidates_found__
Candidatos de categoria hierarquicos agrupados por arquivo do ro-crate, depois por categoria da ontologia, depois por chunk. Exato=1.0, fuzzy=min/comprimento/max(comprimento) por substring, nao-match=0 em bucket sintetico.
PdfToGraph { #fsm-pdftograph }Statechart for transforming PDF documents into knowledge graph inputs.
Indefinido
__undefined__
Estado inicial antes do pipeline PDF-para-grafo começar.
↓
Legibilidade de Texto do PDF Verificada
__text_readiness_checked__
O PDF foi verificado e contém texto plano extraível suficiente para autoria de grafo de conhecimento.
Capability: src/ontobdc/context/plugin/capability/transformation/text_readiness.py
↓
Blocos de Texto do PDF Extraídos final
__pdf_blocks_extracted__
Blocos de texto posicionados foram extraídos de cada página do PDF com PyMuPDF.
Capability: src/ontobdc/context/plugin/capability/transformation/pdf_block.py