Laboratório do Capítulo 4

Tokenização e representação

Divida uma expressão em unidades e observe o que o modelo recebe como entrada.

← Voltar ao capítuloDados sintéticos · atividade local · reinício disponível

Laboratório interativo

Simulação: como o texto vira unidades

Manipule uma variável por vez. O resultado é sintético e serve para raciocinar sobre o conceito.

“inscrição indevida”

O texto ainda está sendo visto como uma sequência inteira.

Esta prática trata apenas da entrada.

Observe como o texto é dividido em unidades que o modelo recebe como sinal.

Opcional: testar esta técnica em Python

Representação lexical mínima com TF-IDF

Instale: pip install scikit-learn

from sklearn.feature_extraction.text import TfidfVectorizer

textos = ["prazo de recurso", "revisão de documento"]
matriz = TfidfVectorizer().fit_transform(textos)
print(matriz.round(2).toarray())

Uso pedagógico: rode o exemplo com dados sintéticos, observe a saída e compare com o que a simulação visual mostrou.