Método reduz a complexidade do mecanismo de atenção de O(N²) para O(N log N) e busca permitir que modelos de inteligência artificial processem contextos extensos com menor exigência computacional
Uma pesquisa desenvolvida por um egresso do Programa de Pós-graduação em Ciência da Computação da Universidade Federal de Minas Gerais (UFMG) apresenta uma alternativa para um dos principais desafios dos grandes modelos de linguagem: o elevado custo computacional necessário para processar grandes quantidades de texto. O trabalho foi divulgado pelo Departamento de Ciência da Computação (DCC) da universidade em 12 de agosto de 2026. (DCC UFMG)
O estudo é de Anderson R. Santos, egresso do mestrado do DCC/UFMG e atualmente professor associado da Faculdade de Computação da Universidade Federal de Uberlândia (UFU). A pesquisa propõe um método chamado RIS, sigla para Reduced Interaction Sampling, capaz de reduzir a complexidade do mecanismo de atenção empregado pelos grandes modelos de linguagem. (DCC UFMG)
O problema dos textos muito longos
Modelos de linguagem precisam estabelecer relações entre diferentes partes de um texto para compreender seu contexto. Nas arquiteturas tradicionais, uma das peças fundamentais desse processo é o mecanismo conhecido como self-attention, ou autoatenção.
O problema aparece quando a quantidade de tokens — pequenas unidades nas quais o texto é dividido — aumenta. Segundo a descrição publicada pelo DCC/UFMG, a complexidade da atenção convencional cresce de forma quadrática, representada por O(N²). Isso significa que aumentar significativamente o contexto pode provocar uma elevação muito maior no volume de operações necessárias. (DCC UFMG)
Na prática, processar documentos extensos, grandes bases textuais ou conversas muito longas pode exigir servidores equipados com grandes quantidades de memória e clusters de GPUs de alto desempenho. Esse cenário aumenta custos e restringe algumas aplicações de IA a infraestruturas computacionais mais robustas.
Técnica reduz complexidade
O RIS busca alterar essa dinâmica. De acordo com o DCC/UFMG, o método reduz a complexidade do mecanismo de atenção de O(N²) para O(N log N). (DCC UFMG)
Em vez de calcular indiscriminadamente todas as possíveis interações entre os elementos do contexto, a técnica utiliza uma amostragem estocástica baseada em propriedades topológicas de redes complexas para selecionar interações consideradas mais relevantes durante o processamento. (DCC UFMG)
A proposta é diminuir substancialmente a quantidade de cálculos necessários conforme o contexto cresce, preservando a capacidade de trabalhar com sequências extensas.
RIS-Kernel aplica método durante a inferência
A partir da técnica, foi desenvolvido também o RIS-Kernel, um motor de inferência independente de modelo. Segundo os pesquisadores, a ferramenta introduz esparsidade no cálculo da atenção durante a execução. (DCC UFMG)
Um aspecto importante é que a abordagem não exige necessariamente o retreinamento dos pesos neurais do modelo. Isso pode facilitar sua utilização com modelos já existentes, pois a otimização ocorre no processamento das interações durante a inferência.
Ser independente de modelo também amplia o interesse da proposta, já que o objetivo não é criar exclusivamente um novo LLM, mas desenvolver uma estratégia computacional que possa ser aplicada ao processamento de diferentes modelos.
Testes foram feitos usando apenas CPUs
Um dos pontos destacados pelo estudo envolve os experimentos realizados em servidores equipados exclusivamente com CPUs, com capacidades de memória entre 16 GB e 128 GB.
Os pesquisadores testaram o RIS-Kernel com o modelo Qwen2-1.5B-Instruct e conseguiram processar contextos extensos em situações nas quais a atenção densa convencional encontrou limitações de memória. (DCC UFMG)
Em um dos testes, envolvendo 65 mil tokens, o método convencional de atenção densa não conseguiu concluir o processamento porque esgotou a memória física disponível. A abordagem proposta conseguiu lidar com esse cenário experimental, segundo os resultados divulgados pelo DCC. (DCC UFMG)
Por que isso é importante para a inteligência artificial?
A expansão da chamada janela de contexto tornou-se uma das principais frentes de desenvolvimento dos modelos generativos. Quanto maior essa capacidade, mais informações um sistema pode considerar simultaneamente.
Isso pode ser útil, por exemplo, na análise de documentos extensos, códigos de programação, relatórios empresariais, trabalhos acadêmicos e grandes conjuntos de informações.
O problema é que aumentar o contexto sem modificar a arquitetura computacional pode elevar rapidamente a necessidade de memória e processamento. Por isso, pesquisas sobre atenção esparsa e mecanismos mais eficientes de processamento ganharam importância na evolução dos modelos de linguagem.
A proposta apresentada por Santos atua justamente nesse gargalo: diminuir o número de interações que precisam efetivamente ser calculadas.
Pesquisa chegou à Scientific Reports
O estudo teórico foi publicado na revista científica Scientific Reports, integrante do portfólio da Nature, sob o DOI 10.1038/s41598-026-59160-z. (DCC UFMG)
Além da publicação científica, os testes em nível de sistema realizados com o RIS-Kernel foram aceitos para apresentação e publicação nos anais da 25ª International Conference on Information & Knowledge Engineering (IKE’26). (DCC UFMG)
A combinação dos dois trabalhos permite avaliar tanto a fundamentação algorítmica da proposta quanto seu comportamento em uma implementação voltada ao processamento de modelos de linguagem.
Tecnologia pode ampliar eficiência dos LLMs
Caso técnicas desse tipo mantenham bons resultados em diferentes modelos, hardwares e tarefas, elas podem contribuir para diminuir uma das barreiras relacionadas ao crescimento dos sistemas de inteligência artificial: a infraestrutura necessária para executar contextos cada vez maiores.
Isso não significa que grandes modelos passarão automaticamente a funcionar com poucos recursos. Treinamento, armazenamento dos parâmetros, geração das respostas e outras operações continuam apresentando custos computacionais próprios. O avanço apresentado pelo estudo está especificamente relacionado ao mecanismo de atenção e ao processamento de contextos extensos.
Ainda assim, reduzir uma operação de comportamento quadrático para uma abordagem próxima de O(N log N) representa uma mudança relevante do ponto de vista algorítmico, principalmente à medida que o número de tokens aumenta.
Pesquisa mantém ligação com Minas Gerais
Embora Anderson R. Santos atualmente seja professor da Universidade Federal de Uberlândia, a pesquisa ganhou destaque também na UFMG devido à trajetória acadêmica do pesquisador, que concluiu o mestrado no Programa de Pós-graduação em Ciência da Computação da instituição em 1999. (DCC UFMG)
O trabalho também evidencia a participação de pesquisadores ligados às universidades mineiras em uma área que atualmente concentra investimentos e pesquisas em todo o mundo.
Com a expansão dos LLMs para tarefas que exigem documentos e contextos cada vez maiores, métodos capazes de reduzir memória e processamento podem se tornar uma peça importante na busca por sistemas de inteligência artificial mais eficientes e acessíveis.
A pesquisa com o RIS mostra uma possível direção: em vez de simplesmente aumentar a infraestrutura para acompanhar contextos maiores, reduzir de forma inteligente a quantidade de interações que o modelo precisa calcular.
Fonte principal: Departamento de Ciência da Computação da UFMG — publicação de 12 de agosto de 2026.