Um novo avanço para o PLN em português
O estudo apresenta duas frentes complementares: o JabuticaBERT, baseado na arquitetura DeBERTa-V3, e o modernJabuticaBERT, baseado na arquitetura ModernBERT.
Ambos foram treinados do zero, a partir do corpus Jabuticaba, com o objetivo de evitar dependências de modelos originalmente centrados no inglês e construir representações linguísticas mais alinhadas ao português brasileiro.
Essa decisão metodológica é central. Ao treinar modelos do zero com dados em português, o projeto melhora a adequação do vocabulário, reduz a fragmentação excessiva de palavras e amplia a eficiência no processamento de textos reais, de diferentes domínios e estilos.
Mais eficiência, menos custo computacional
O modelo JabuticaBERT Large, com 434 milhões de parâmetros, alcançou desempenho comparável ao Albertina 884M em múltiplos benchmarks, utilizando menos da metade dos parâmetros.
Esse resultado mostra que o avanço não depende apenas de modelos maiores. Com arquitetura adequada, tokenização eficiente e dados de alta qualidade, é possível entregar desempenho de ponta com menor custo computacional.
Na prática, isso abre caminho para aplicações mais acessíveis, escaláveis e viáveis em ambientes acadêmicos, institucionais e produtivos.
Modelos preparados para documentos mais longos
Muitos modelos para português operavam com janelas de até 512 tokens, o que restringia sua capacidade de lidar com documentos extensos, como textos jurídicos, relatórios técnicos, materiais acadêmicos e grandes bases documentais.
O modernJabuticaBERT foi desenvolvido para superar essa barreira, com suporte a contextos de até 8.192 tokens, ampliando significativamente seu potencial em tarefas que exigem compreensão de documentos longos, recuperação de informação e análise textual em escala.
SoberanIA na vanguarda da compreensão de linguagem em português
Ao criar modelos modernos para compreensão de linguagem em português brasileiro, o SoberanIA fortalece a infraestrutura científica necessária para novas aplicações em IA, desde sistemas de busca e classificação até soluções avançadas para gestão pública, pesquisa e atendimento ao cidadão.
Com o JabuticaBERT, o projeto reafirma sua posição na vanguarda da inteligência artificial em português, mostrando que o Brasil pode construir suas próprias bases tecnológicas com eficiência, rigor científico e autonomia.