🏫 EE. Oito de Abril — Laboratório de Ciência de Dados

Processamento de Linguagem Natural — Tokenização Subword e Análise de Sentimentos

Turma: 3ºB — Ciência de Dados | Modelo: Multilingual-MiniLM

👤 Identificação do Estudante

📈 Métricas Globais da Avaliação do Modelo (Notebook Python)

Resultados obtidos após a avaliação do modelo no conjunto de teste (Dataset B2W-Reviews):

0.9125
Test Accuracy
0.8940
Test Precision
0.9310
Test Recall
0.2412
Test Loss

🌐 Entrada da Avaliação (Cole um texto da internet)

🔤 Tokens Gerados (Subword Unit)

Legenda: [CLS]/[SEP] Especial | subword Token Real | [PAD] Preenchimento

Vetor de Token IDs (Tensor input_ids):

[ ... ]

📊 Classificação de Sentimento (Modelo Finetuned)

Classe 1: Positivo (Nota ≥ 4) 0%
Classe 0: Negativo (Nota < 4) 0%
Cole um texto e clique em "Executar Pipeline" para visualizar a análise.

✏️ Exercícios de Fixação do Roteiro (Aula 3)

Responda às questões abaixo para gerar o relatório em PDF e enviar no AVA.

1. Quais os resultados da Avaliação do modelo no seu notebook Python? (Accuracy, Precision, Recall, Loss)

2. Para que é utilizado o tokenizer em um modelo de PLN?

3. Qual é a função do parâmetro max_length do tokenizer?

Escola EE. Oito de abril

Relatório de Atividade Prática — Ciência de Dados

Processamento de Linguagem Natural — Modelos de Linguagem I

Estudante:

Turma:

Data de Emissão:

Exercícios de Fixação (Aula 3)

1. Quais os resultados da Avaliação do modelo no seu notebook Python? (Accuracy, Precision, Recall, Loss)

2. Para que é utilizado o tokenizer em um modelo de PLN?

3. Qual é a função do parâmetro max_length do tokenizer?

EE. Oito de abril — Documento gerado pelo Laboratório de PLN. Pronto para envio no AVA.