Laboratório do Capítulo 4
Tokenização e representação
Divida uma expressão em unidades e observe o que o modelo recebe como entrada.
← Voltar ao capítuloDados sintéticos · atividade local · reinício disponível
Laboratório interativo
Simulação: como o texto vira unidades
Manipule uma variável por vez. O resultado é sintético e serve para raciocinar sobre o conceito.
“inscrição indevida”
inscriçãoindevida
O texto ainda está sendo visto como uma sequência inteira.
Esta prática trata apenas da entrada.
Observe como o texto é dividido em unidades que o modelo recebe como sinal.
Opcional: testar esta técnica em Python
Representação lexical mínima com TF-IDF
Instale: pip install scikit-learn
from sklearn.feature_extraction.text import TfidfVectorizer
textos = ["prazo de recurso", "revisão de documento"]
matriz = TfidfVectorizer().fit_transform(textos)
print(matriz.round(2).toarray()) Uso pedagógico: rode o exemplo com dados sintéticos, observe a saída e compare com o que a simulação visual mostrou.