Processamento de Linguagem Natural — Tokenização Subword e Análise de Sentimentos
Turma: 3ºB — Ciência de Dados | Modelo: Multilingual-MiniLMResultados obtidos após a avaliação do modelo no conjunto de teste (Dataset B2W-Reviews):
Legenda: [CLS]/[SEP] Especial | subword Token Real | [PAD] Preenchimento
Responda às questões abaixo para gerar o relatório em PDF e enviar no AVA.
max_length padroniza o tamanho do texto. Frases maiores são cortadas (truncation) e frases menores ganham tokens de preenchimento [PAD] (padding) para que todos os textos fiquem com o mesmo tamanho numérico no lote.
Processamento de Linguagem Natural — Modelos de Linguagem I
Estudante:
Turma:
Data de Emissão:
1. Quais os resultados da Avaliação do modelo no seu notebook Python? (Accuracy, Precision, Recall, Loss)
2. Para que é utilizado o tokenizer em um modelo de PLN?
3. Qual é a função do parâmetro max_length do tokenizer?