Análise Comparativa de Small Language Models (SLMs) Pré-Treinados com Phi-2: Adaptação para o Português e Desempenho em Tarefas de Resposta a Perguntas com Dados do SQUAD e da Wikipédia Miguel Lopes da Silva Filho1 , Leonardo Bruscagini1 , Leonardo Silveira2 , Luı́s A. S. Pessoa1 , Thiago Felipe de Almeida1 , Vagner Sanches Vasconcelos1 , Vitor Pereira Andrade1 1 Centro de Pesquisa e Desenvolvimento em Telecomunicações (CPqD) Polo II de Alta Tecnologia – Campinas – SP – Brasil 2 Centro Ciências Exatas, Ambientais e de Tecnologia Pontifı́cia Universidade Católica de Campinas Campinas – SP - Brasil mfilho,luisp,tfelipea@cpqd.com.br, leonardo.bruscagini@gmail.com,leonardo.silveira@ga.ita.br, vagner vasconcelos@metrosp.com.br,vitorandrade@me.com Abstract. This paper evaluates the performance of Microsoft’s Phi-2 pretrained language model in question answering tasks, using Portuguese adaptation and the SQUAD and Wikipedia databases. The model was adjusted with adapters for the Portuguese language and for the specific task, resulting in improvements in metrics such as F1 score, precision, exact match, BLEU and ROUGE-1 compared to the base model. Although training is still ongoing, preliminary results are promising, indicating that continued training could lead to even better performance. The study contributes to the evaluation of pre-trained Small Language Models (SLMs) in specific scenarios, providing valuable insights for the development of more efficient and accurate natural language processing applications. Resumo. Este estudo avalia o desempenho do modelo de linguagem prétreinado Phi-2 da Microsoft em tarefas de resposta a perguntas, utilizando adaptação para português e as bases de dados SQUAD e Wikipedia. O modelo foi ajustado com adaptadores para a lı́ngua portuguesa e para a tarefa especı́fica, resultando em melhorias em métricas como F1 score, precision, exact match, BLEU e ROUGE-1 em comparação com o modelo de base. Apesar de o treinamento ainda estar em andamento, os resultados preliminares são promissores, indicando que a continuação do treinamento pode levar a um desempenho ainda melhor. O estudo contribui para a avaliação de Small Language Models (SLMs) pré-treinados em cenários especı́ficos, fornecendo insights valiosos para o desenvolvimento de aplicações de processamento de linguagem natural mais eficientes e precisas. 1. Introdução O presente artigo tem como objetivo realizar a avaliação de Small Language Models (SLMs) pré-treinados com a utilização do Phi-2 em conjunto com as bases de dados SQUAD e Wikipedia. A importância dessa pesquisa reside na necessidade de compreender o desempenho desses modelos em cenários especı́ficos, possibilitando avanços na área de processamento de linguagem natural. Através da análise dos resultados obtidos, será possı́vel identificar as potencialidades e limitações dos SLMs pré-treinados, contribuindo para o desenvolvimento de aplicações mais eficientes e precisas. 1.1. Contextualização da Importância dos Modelos de Linguagem Pré-Treinados (SLMs) Os modelos de linguagem pré-treinados desempenham um papel fundamental no processamento de linguagem natural, sendo largamente utilizados em tarefas como tradução automática, resumo de textos, geração de diálogos e resposta a perguntas. A contextualização da importância desses modelos reside na necessidade de compreender sua eficácia em diferentes contextos e cenários de aplicação, visando aprimorar a qualidade das soluções desenvolvidas com base nessa tecnologia. [Oliveira et al. 2022] 1.2. Motivação e Objetivos da Pesquisa A motivação para este estudo surge da necessidade de avaliar o desempenho do modelo Phi-2 em conjunto com as bases de dados SQUAD e Wikipedia. Objetiva-se compreender como esses modelos se comportam em tarefas especı́ficas de resposta a perguntas, identificando suas potencialidades e limitações. Além disso, busca-se contribuir para o avanço da área de processamento de linguagem natural, fornecendo insights valiosos para o desenvolvimento de aplicações mais eficientes e precisas. 1.3. Estrutura do Artigo Este artigo está organizado da seguinte forma: a Seção 2 apresenta a fundamentação teórica, abordando conceitos relevantes sobre modelos de linguagem e seu prétreinamento. A Seção 3 descreve a metodologia de avaliação, detalhando a seleção dos modelos, o Phi-2 e as bases de dados utilizadas. A Seção 4 apresenta os experimentos realizados e discute os resultados obtidos. A Seção 5 aborda trabalhos relacionados, destacando estudos anteriores sobre avaliação de SLMs e outras pesquisas envolvendo as bases de dados SQUAD e Wikipedia. Por fim, a Seção 6 conclui o artigo, ressaltando as principais contribuições do estudo e apontando limitações e sugestões para trabalhos futuros. 2. Fundamentação Teórica 2.1. Modelos de Linguagem e sua Relevância na Atualidade Os modelos de linguagem desempenham um papel crucial no processamento de linguagem natural, permitindo que sistemas computacionais compreendam e gerem texto de forma eficiente [Suave 2024]. Esses modelos são treinados em grandes volumes de dados de texto, aprendendo padrões e estruturas da linguagem [Stakoviak et al. 2023]. Na atualidade, os modelos de linguagem pré-treinados têm sido amplamente utilizados em diversas aplicações, como tradução automática, geração de texto, resposta a perguntas e classificação de sentimentos [Costa 2024]. 2 de 9 2.2. Pré-Treinamento de Modelos de Linguagem O pré-treinamento de modelos de linguagem envolve o treinamento desses modelos em grandes volumes de dados de texto, antes de serem aplicados a tarefas especı́ficas. Essa abordagem permite que os modelos aprendam representações gerais da linguagem, que podem ser posteriormente ajustadas (fine-tuning) para tarefas especı́ficas. O pré-treinamento tem demonstrado resultados superiores em comparação com o treinamento a partir do zero, especialmente em cenários com poucos dados de treinamento. [Pontes 2022] 3. Metodologia de Avaliação 3.1. Seleção dos Modelos de Linguagem a Serem Avaliados Para este estudo, selecionamos o modelo Phi-2 para avaliação. O Phi-2 é um grande modelo de linguagem pré-treinado, desenvolvido pela Microsoft, que tem demonstrado resultados promissores em diversas tarefas de processamento de linguagem natural. [Beke and Zitouni ] 3.2. Descrição das Bases de Dados Utilizadas: SQUAD e Wikipedia Para avaliar o desempenho do modelo Phi-2, utilizamos duas bases de dados amplamente utilizadas na área de processamento de linguagem natural: SQUAD (Stanford Question Answering Dataset) e Wikipedia. O SQUAD é um conjunto de dados para a tarefa de resposta a perguntas, contendo mais de 100.000 perguntas criadas por crowdsourcing e suas respectivas respostas, baseadas em um conjunto de artigos da Wikipedia [Su et al. 2019]. A base de dados Wikipedia é composta por milhões de artigos em diversos idiomas, cobrindo uma ampla gama de tópicos. Essa base de dados é frequentemente utilizada como fonte de conhecimento para o treinamento e avaliação de modelos de linguagem [Church et al. 2021, Zhu et al. 2022]. 4. Experimentos e Resultados Foram coletados dois conjuntos de dados: um conjunto de dados de frases em português e um conjunto de dados de perguntas e respostas em português. O conjunto de dados de frases em português foi utilizado para o ajuste fino do tipo Fine-Tuning (QLoRa). O conjunto de dados de perguntas e respostas em português foi utilizado para os ajustes finos do tipo Fine-Tuning (QLoRa) - SQUAD em português e Fine-Tuning (QLoRa) - SQUAD em português (modificado). Figure 1. Metodologia de treinamento e testes 3 de 9 4.1. Configuração dos Experimentos Para avaliar o modelo Phi-2 utilizando as bases de dados SQUAD e Wikipedia, realizamos os seguintes experimentos: • Treinamento do modelo Phi-2 com adaptadores para português (Phi-2-PT): Utilizando um conjunto de dados de treinamento de 63.400 exemplos e um conjunto de validação de 500 exemplos. O modelo foi treinado por 1900 etapas, equivalentes a 12 épocas, com um tamanho de lote de treinamento por dispositivo de 2 e um acúmulo de gradiente de 16 etapas. O tempo total de treinamento foi de 87 horas, e foram geradas 8 versões do modelo. Figure 2. Treinamento do modelo Phi-2-PT No inı́cio do treinamento, ambas as perdas caem rapidamente, um sinal positivo de que o modelo está aprendendo bem as caracterı́sticas dos dados. No entanto, há algumas flutuações nas curvas de perda, especialmente em torno dos passos 400 e 800. Isso pode indicar que o modelo está enfrentando dificuldades temporárias com certos lotes de dados. As curvas de perda continuam a diminuir ao longo dos passos, indicando que o modelo está melhorando sua capacidade de generalização. Contudo, as flutuações mencionadas sugerem que o modelo poderia se beneficiar de ajustes na taxa de aprendizado ou de técnicas adicionais de regularização para suavizar o treinamento. Quanto à taxa de aprendizado, a curva começa alta e diminui progressivamente ao longo do treinamento. Este é um padrão comum em estratégias de decaimento da taxa de aprendizado, onde uma alta taxa inicial permite grandes ajustes rápidos nos pesos, enquanto a redução gradual ajuda a refinar o modelo. A diminuição da taxa de aprendizado parece coincidir com as flutuações na perda, o que pode indicar que a taxa inicial estava alta demais, causando instabilidade. • Teste do modelo Phi-2 com o dataset de teste do SQUAD em inglês: Utilizando um conjunto de dados de treinamento de 87.510 exemplos e um conjunto de validação de 500 exemplos. O modelo foi treinado por 2735 etapas, 4 de 9 equivalentes a uma época, com um tamanho de lote de treinamento por dispositivo de 2 e um acúmulo de gradiente de 16 etapas. O tempo total de treinamento foi de 114 horas, e foram geradas 6 versões do modelo. Figure 3. Treinamento do modelo Phi-2-PT-QA-1 A curva de perda de treinamento (linha laranja) cai significativamente no inı́cio e continua a diminuir, estabilizando-se em um valor baixo, o que indica bom aprendizado a partir dos dados de treinamento. A curva de perda de validação (linha azul) também cai no inı́cio, mas se estabiliza em um platô, sugerindo que o modelo não está melhorando sua capacidade de generalização após certo ponto. A curva da taxa de aprendizado (linha verde) começa alta e diminui gradualmente, permitindo grandes ajustes iniciais nos pesos e refinamentos subsequentes. No entanto, a estabilização da perda de validação pode indicar a necessidade de ajustar a taxa de aprendizado mais cedo para evitar o platô. Com um batch size de 2 e acumulação de gradientes de 16, o modelo processa efetivamente 32 exemplos antes de atualizar os pesos, o que estabiliza as atualizações de gradiente, mas prolonga o tempo de treinamento. O treinamento foi realizado em uma única época com 2735 steps, levando a 114 horas. Embora uma época longa permita que o modelo veja todos os dados, também pode prolongar o treinamento. Com 500 exemplos de validação, há uma quantidade razoável de dados para avaliar a generalização, mas a estabilização da perda de validação sugere que o modelo pode estar sobreajustando aos dados de treinamento. Para melhorar a generalização, poderia ser útil aumentar o conjunto de validação ou aplicar técnicas de regularização, como dropout ou data augmentation. Ajustar a taxa de aprendizado de forma mais agressiva ou utilizar técnicas como a taxa de aprendizado cı́clica poderia ajudar a evitar o platô na perda de validação. Para reduzir o tempo de treinamento, otimizações como ajustar o tamanho do lote ou usar múltiplas GPUs podem ser benéficas. • Teste do modelo Phi-2-PT-QA-2 com o dataset de teste do SQUAD em português: Utilizando um conjunto de dados de treinamento de 87.510 exemplos e um con5 de 9 junto de validação de 5.500 exemplos. O modelo foi treinado por 2800 etapas, equivalentes a um pouco mais de uma época, com um tamanho de lote de treinamento por dispositivo de 2 e um acúmulo de gradiente de 16 etapas. O tempo total de treinamento foi de 154 horas, e foram geradas 3 versões do modelo. Figure 4. Treinamento do modelo Phi-2-PT-QA-2 A curva de perda de treinamento (linha laranja) cai rapidamente no inı́cio e continua a diminuir gradualmente, indicando bom aprendizado dos dados de treinamento. A curva de perda de validação (linha azul) também diminui inicialmente e continua a cair, sugerindo que o modelo está melhorando sua capacidade de generalização. A taxa de aprendizado (linha verde) começa alta e diminui gradualmente, permitindo ajustes iniciais grandes e refinamentos posteriores. Esta alta inicial na taxa de aprendizado ajuda na rápida redução das perdas de treinamento e validação, mostrando uma boa configuração inicial. Com um batch size de 2 e acumulação de gradientes de 16, o modelo processa efetivamente 32 exemplos antes de atualizar os pesos, o que estabiliza as atualizações de gradiente, mas prolonga o tempo de treinamento. Foram usados 87.510 exemplos para treinamento e 5.500 para validação, oferecendo uma boa base de dados, embora 20% dos dados não possuı́ssem respostas, impactando a qualidade do treinamento. O treinamento, realizado em pouco mais de uma época com 2800 steps, durou 154 horas usando uma única GPU T4 (16Gb). O tempo longo de treinamento é esperado devido ao batch size pequeno e à acumulação de gradiente. 4.2. Métricas de Avaliação Utilizadas Para avaliar o desempenho do modelo Phi-2 em resposta a perguntas, utilizamos as seguintes métricas: • F1 score: Média harmônica entre precisão e revocação, variando de 0 a 1, sendo 1 o melhor resultado. 6 de 9 • Precision: Proporção de respostas corretas entre todas as respostas dadas pelo modelo, variando de 0 a 1. • Recall: Proporção de respostas corretas encontradas pelo modelo entre todas as respostas corretas possı́veis, variando de 0 a 1. • Exact Match: Porcentagem de respostas exatamente iguais às respostas corretas. • BLEU: Métrica de avaliação de qualidade de tradução automática, variando de 0 a 1, sendo 1 o melhor resultado. • ROUGE-1: Métrica de avaliação de qualidade de sumarização, baseada na sobreposição de n-gramas, variando de 0 a 1. • METEOR: Métrica de avaliação de qualidade de tradução automática, variando de 0 a 1, sendo 1 o melhor resultado. 4.3. Análise e Discussão dos Resultados A análise aprofundada se concentra nos resultados das métricas para os três modelos de linguagem: Modelo Base, 1º Fine-tuning, 2º Fine-tuning e 3º Fine-tuning, avaliandoos individualmente e identificando seus pontos fortes e fracos com base nos seguintes resultados: Modelo de Base (Phi-2) Métricas Wikipedia Português SQuAD Inglês Fine-tuning SQuAD Português Phi-2-PT Phi-2-PT-QA-1 Phi-2-PT-QA-2 perplexity 54,4263 - - 50,7813 (-6,7%) - - f1 score - 0,5419 0,2291 (-57,7%) - 0,5894 (157,3%) 0,6401 (179,4%) precision - 0,4778 0,1760 (-63,2%) - 0,6298 (257,8%) 0,6855 (289,5%) recall - 0,8587 0,6438 (-25,0%) - 0,6173 (-4,1%) 0,6482 (0,7%) exact match - 0,2736 0,0598 (-78,1%) - 0,4160 (595,7%) 0,3385 (466,1%) bleu - 0,3394 0,1345 (-60,4%) - 0,5169 (284,3%) 0,5710 (324,5%) rouge1 - 0,5379 0,2763 (-48,6%) - 0,5973 (116,2%) 0,6367 (130,4%) meteor - 0,5650 0,2870 (-49,2%) - 0,4656 (62,2%) 0,5221 (81,9%) Table 1. Resultados de avaliação do modelo Phi-2 com diferentes datasets e etapas de fine-tuning. O modelo Base apresenta resultados satisfatórios em algumas métricas, como F1score para o dataset Wikipedia em português (0,5419) e BLEU para o dataset Squad em português (0,3394). No entanto, o modelo apresenta um desempenho inferior nas demais métricas, como Precisão (0,0000) e Rouge1 (0,0000). O 1º Fine-Tuning apresenta uma melhora significativa em relação ao modelo Base na maioria das métricas. Destaca-se o aumento expressivo na Precisão para o dataset Squad em português (0,4778), BLEU para o dataset Squad em português (0,5169) e Rouge1 para o dataset Squad em português (0,5973). A perplexidade também apresenta uma redução considerável (50,7813), indicando que o modelo consegue melhor compreender a estrutura da linguagem portuguesa. O 2º Fine-Tuning apresenta o melhor desempenho geral entre os modelos, com resultados superiores em todas as métricas. Destaca-se a alta Precisão para o dataset Squad em português (0,6855), BLEU para o dataset Squad em português (0,5710) e Rouge1 para o dataset Squad em português (0,6367). O modelo também apresenta um bom desempenho nas demais métricas, como F1-score para o dataset Squad em português (0,6401) e Rouge1 para o dataset Wikipedia em português (0,5973). 7 de 9 O 3º fine-tuning demonstra ser o modelo mais robusto e eficaz entre os três, com desempenho superior em diversas métricas cruciais para a tradução automática, como F1score, BLEU, ROUGE-L e METEOR. O modelo se destaca pela sua maior precisão na identificação de entidades nomeadas, tradução automática mais fluente e similar à linguagem humana, melhor sobreposição léxica e similaridade semântica considerável. Apesar da falta de dados para a perplexidade, os resultados indicam que o 3º fine-tuning representa um avanço significativo na capacidade do modelo de gerar traduções de alta qualidade. 5. Trabalhos Relacionados 5.1. Estudos Anteriores sobre Avaliação de SLMs Diversos estudos anteriores têm se concentrado na avaliação de pequenos modelos de linguagem pré-treinados em diferentes tarefas e cenários. Por exemplo, o estudo de [Raffel et al. 2020] apresenta uma avaliação abrangente de modelos de linguagem prétreinados em diversas tarefas, incluindo resposta a perguntas, sumarização e tradução automática. Outro estudo relevante é o de [Wang et al. 2018], que propõe um benchmark para avaliação de modelos de linguagem em tarefas de compreensão de leitura. 5.2. Outras Pesquisas Envolvendo as Bases de Dados SQUAD e Wikipedia As bases de dados SQUAD e Wikipedia têm sido amplamente utilizadas em pesquisas relacionadas a resposta a perguntas e compreensão de texto. Por exemplo, o estudo de [Rajpurkar et al. 2016] apresenta o SQUAD e avalia o desempenho de modelos de linguagem nessa base de dados. Outro estudo relevante é o de [Petroni et al. 2019], que investiga a capacidade de modelos de linguagem pré-treinados em armazenar conhecimento factual. 6. Conclusão 6.1. Principais Contribuições do Estudo Este estudo contribui para a avaliação de pequenos modelos de linguagem pré-treinados, especificamente o Phi-2, em tarefas de resposta a perguntas utilizando as bases de dados SQUAD e Wikipedia. Os resultados obtidos demonstram que o ajuste do modelo para a lı́ngua portuguesa e para a tarefa especı́fica resultou em um melhor desempenho em comparação com o modelo de base. Essa avaliação fornece insights valiosos para o desenvolvimento de aplicações de processamento de linguagem natural mais eficientes e precisas. 6.2. Limitações e Sugestões para Trabalhos Futuros Uma limitação deste estudo é que o treinamento ainda está em andamento, e os resultados apresentados são preliminares. Portanto, sugere-se a continuação do treinamento por mais tempo, visando obter resultados ainda melhores. Além disso, seria interessante avaliar o modelo Phi-2-PT-QA-1 em outras bases de dados e tarefas, a fim de compreender seu desempenho em cenários mais amplos. Por fim, a investigação de técnicas de pré-treinamento e ajuste fino mais eficientes pode contribuir para o aprimoramento do desempenho de modelos de linguagem em tarefas especı́ficas. 8 de 9 7. Agradecimentos Gostaria de expressar nossa profunda gratidão ao Programa de Residência Tecnológica, que proporcionou uma oportunidade inestimável de aprendizado em processamento de linguagem natural. Agradecemos sinceramente à Softex e ao MCTI por apoiarem este programa, assim como ao CPqD e à PUC Campinas por suas parcerias essenciais. Nosso reconhecimento especial aos mentores do CPqD, Srs. Luis Pessoa, Felipe Almeida e Miguel Lopes, cujas orientações foram fundamentais para o sucesso deste projeto e também ao Prof. Leonardo Silveira, da PUC Campinas, por sua mentoria inspiradora e apoio constante ao longo desta jornada. References Beke, A. and Zitouni, T. Fine-tuning phi models for informed decision support in supply chain optimisation. Church, K. W., Chen, Z., and Ma, Y. (2021). Emerging trends: A gentle introduction to fine-tuning. Natural Language Engineering, 27(6):763–778. Costa, V. J. L. (2024). Chatgpt: Uma análise da ferramenta aplicada no processo de desenvolvimento de software. Oliveira, B. S. N., do Rêgo, L. G. C., Peres, L., da Silva, T. L. C., and de Macêdo, J. A. F. (2022). Processamento de linguagem natural via aprendizagem profunda. Sociedade Brasileira de Computação. Petroni, F., Rocktäschel, T., Lewis, P., Bakhtin, A., Wu, Y., Miller, A. H., and Riedel, S. (2019). Language models as knowledge bases? arXiv preprint arXiv:1909.01066. Pontes, L. B. L. (2022). Investigação de modelos neurais baseados na arquitetura transformer para sumarização automática de código-fonte. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., and Liu, P. J. (2020). Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of machine learning research, 21(140):1–67. Rajpurkar, P., Zhang, J., Lopyrev, K., and Liang, P. (2016). Squad: 100,000+ questions for machine comprehension of text. arXiv preprint arXiv:1606.05250. Stakoviak, F. H. M. et al. (2023). Inovação em acesso à informação em biotecnologia: desenvolvimento de um mecanismo de busca inteligente baseado em processamento de linguagem natural. Su, D., Xu, Y., Winata, G. I., Xu, P., Kim, H., Liu, Z., and Fung, P. (2019). Generalizing question answering system with pre-trained language model fine-tuning. In Proceedings of the 2nd workshop on machine reading for question answering, pages 203–211. Suave, A. A. (2024). Inteligência Artificial. Freitas Bastos. Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., and Bowman, S. R. (2018). Glue: A multi-task benchmark and analysis platform for natural language understanding. arXiv preprint arXiv:1804.07461. Zhu, H., Dong, L., Wei, F., Qin, B., and Liu, T. (2022). Transforming wikipedia into augmented data for query-focused summarization. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2357–2367. 9 de 9
0
You can add this document to your study collection(s)
Sign in Available only to authorized usersYou can add this document to your saved list
Sign in Available only to authorized users(For complaints, use another form )