Pesquisa com participação da UFLA recebe prêmio de melhor artigo em simpósio nacional de Engenharia de Software
Uma pesquisa que investiga o uso de inteligência artificial na avaliação de arquiteturas de software, com participação da Universidade Federal de Lavras (UFLA), recebeu o prêmio de melhor artigo no Simpósio Brasileiro de Componentes, Arquiteturas e Reutilização de Software (SBCARS).
Intitulado How Reliable Are LLM Evaluations of Microservice Architecture Diagrams?, o trabalho é de autoria do professor Gustavo do Vale, do Departamento de Computação Aplicada (DAC/ICET/UFLA), em colaboração com pesquisadores da Universidade Federal de Minas Gerais (UFMG), o estudante de graduação João Luiz Cerqueira, o estudante de mestrado Mateus Dutra e o professor Eduardo Figueiredo.
A pesquisa investiga até que ponto os Modelos de Linguagem de Grande Porte (LLMs), usados em sistemas de inteligência artificial generativa, podem ser utilizados para avaliar aspectos da Engenharia de Software que tradicionalmente dependem da análise de especialistas.
No estudo, os pesquisadores avaliaram a capacidade desses modelos de analisar diagramas que representam a arquitetura de sistemas baseados em microsserviços. Para isso, foram considerados cinco critérios de qualidade: clareza, consistência, completude, precisão e nível de detalhamento. Os diagramas foram apresentados aos modelos de duas formas, como imagens e como uma representação textual estruturada. As avaliações foram realizadas com dois modelos multimodais de inteligência artificial, GPT-5 e Claude Sonnet 4.6.
Para verificar a confiabilidade das análises produzidas pelos modelos, os pesquisadores compararam os resultados com avaliações realizadas por profissionais da área. Ao todo, 16 engenheiros de software participaram da auditoria utilizada como referência no estudo. A pesquisa envolveu 360 avaliações e 253 comparações entre justificativas produzidas pelos modelos. Os resultados mostraram um nível relevante de concordância entre as avaliações dos LLMs e as realizadas pelos especialistas.
O maior alinhamento foi observado na avaliação da completude dos diagramas, enquanto a clareza foi o critério que apresentou maior divergência entre as avaliações dos modelos e as dos especialistas. O estudo também analisou se a forma de apresentação dos diagramas influenciava a qualidade das respostas. Nos casos em que os especialistas indicaram preferência por uma das justificativas, aquelas produzidas a partir da análise visual das imagens dos diagramas foram escolhidas em 60,8% das comparações.
Para Gustavo do Vale, os resultados ajudam a compreender não apenas as possibilidades de aplicação dos LLMs na Engenharia de Software, mas também seus limites. “À medida que esses modelos passam a ser utilizados em atividades cada vez mais complexas do desenvolvimento de software, precisamos entender em quais situações podemos confiar em suas avaliações. Nossos resultados mostram que eles podem ser úteis para apoiar uma primeira análise de arquiteturas e chamar a atenção para possíveis problemas, mas ainda não devem substituir a avaliação de especialistas”, explica o pesquisador.
Segundo os autores, uma possível aplicação prática é utilizar essas ferramentas nas etapas iniciais de revisão de arquiteturas de software. Os modelos poderiam auxiliar na identificação de aspectos que merecem atenção e na priorização dos pontos que posteriormente serão examinados com maior profundidade por profissionais da área.
O Simpósio Brasileiro de Componentes, Arquiteturas e Reutilização de Software (SBCARS) é um dos principais fóruns científicos brasileiros dedicados a pesquisas sobre arquitetura, componentes e reutilização de software. Em 2026, o evento ocorreu entre os dias 8 e 11 de setembro, em São Paulo, como parte do Congresso Brasileiro de Software: Teoria e Prática (CBSoft), que reúne pesquisadores, estudantes e profissionais de diferentes áreas da Computação e da Engenharia de Software.


