SGAEIA Research Series — Article 19

Aridio Silva
Independent Researcher, Brazil
Creator of SGAEIA — Secure Governed Autonomous Edge Intelligence Architecture
ORCID: 0009-0008-2411-6995

DOI: 10.5281/zenodo.23300168

Copyright: © 2026 Aridio Silva | Licença: CC BY 4.0

Resumo

Low-Rank Adaptation (LoRA) tornou possível especializar modelos de grande porte treinando uma fração dos parâmetros e preservando o modelo-base congelado. Essa eficiência favoreceu um ecossistema de adaptadores pequenos, intercambiáveis e servidos dinamicamente, mas também criou um novo objeto de confiança: um arquivo compacto pode alterar o comportamento do modelo que planeja, seleciona ferramentas, delega tarefas e produz efeitos no mundo. Este artigo parte dos fundamentos, variantes e práticas de engenharia apresentados no manuscrito autoral e os reinterpreta para agentes de AI, sistemas multiagentes e ambientes edge-cloud. A literatura mostra que fine-tuning pode degradar alinhamento, adaptadores compartilhados podem transportar backdoors e composições de módulos individualmente benignos podem produzir comportamento inseguro. Em resposta, o artigo propõe propriedades candidatas — ainda não normativas — para identidade, compatibilidade, composição, autoridade, isolamento, revogação e evidência. A conclusão central é que LoRA deve ser governada não apenas como um artefato de machine learning, mas como uma dependência comportamental capaz de influenciar ações consequentes.

Palavras-chave: LoRA; agentes de AI; PEFT; AI Security; supply chain; multi-tenancy; revogação; sistemas multiagentes; Edge AI; governança.

Capa — LoRA em Agentes de AI
© 2026 Aridio Silva | Project SGAEIA | CC BY 4.0

1. Por que LoRA muda de significado quando o modelo se torna agente

LoRA surgiu como resposta a um problema econômico e de engenharia: adaptar um modelo inteiro para cada tarefa exige armazenar, treinar e operar cópias completas de centenas de milhões ou bilhões de parâmetros. Hu et al. propuseram congelar os pesos do modelo-base e representar a atualização de cada matriz selecionada por duas matrizes de posto reduzido. Nos experimentos originais, a abordagem reduziu drasticamente os parâmetros treináveis e, em tarefas avaliadas, alcançou qualidade comparável ao fine-tuning completo [1]. O manuscrito que deu origem a este artigo organiza essa evolução desde dimensão intrínseca e métodos predecessores até QLoRA, DoRA, LoRA+, PiSSA, serving multiadaptador e adoção industrial.

O significado operacional do adaptador, porém, muda quando o modelo deixa de apenas responder e passa a agir. Em um chatbot, uma alteração comportamental pode produzir uma resposta inadequada. Em um agente com ferramentas, a mesma alteração pode influenciar seleção de API, criação de código, acesso a dados, delegação, roteamento entre especialistas ou execução de uma ação irreversível. O risco não decorre de LoRA ser intrinsecamente maliciosa; decorre da combinação entre uma dependência comportamental mutável e um sistema que possui capacidades externas.

Este artigo faz, portanto, uma distinção essencial. LoRA fornece uma forma eficiente de modificar capacidade ou comportamento; ela não concede, por si, autoridade legítima. Se a carga de um adaptador ampliar silenciosamente as permissões efetivas de um agente, o problema está na arquitetura de governança, não na álgebra de baixo posto. Essa separação entre comportamento, capacidade e autoridade orienta toda a análise seguinte.

2. O mecanismo em termos essenciais

Considere uma matriz congelada do modelo-base, W0 em R^(d x k). LoRA representa a atualização aprendida como o produto de duas matrizes menores:

Equação 1 — Atualização LoRA em forma matricial
Equação 1 — Atualização LoRA em forma matricial. A configuração efetiva é W' = W0 + (alpha/r)BA: W0 permanece congelada, enquanto as matrizes compactas A e B são treináveis. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.

em que A está em R^(r x k), B está em R^(d x r) e r << min(d,k). Durante o treinamento, W0 permanece congelada e apenas A e B são ajustadas. A economia decorre de treinar aproximadamente r(d+k) parâmetros em vez de dk, condicionada às camadas escolhidas, ao posto, à escala e a outros hiperparâmetros [1].

Figura 1 — Modelo-base congelado e atualização LoRA
Figura 1 — Modelo-base congelado e atualização LoRA. O adaptador aprende uma atualização de baixo posto que modifica o comportamento efetivo sem substituir todos os pesos do modelo. A eficiência é real, mas a equivalência de qualidade com fine-tuning completo depende do modelo, da tarefa, do orçamento e da configuração. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.

Os adaptadores podem ser mantidos separados, fundidos aos pesos para uma implantação estática ou carregados dinamicamente. A afirmação frequente de “nenhuma latência adicional” aplica-se principalmente ao caso fundido; serving dinâmico e multiadapter introduzem custos de carga, movimentação de memória, batching e roteamento. Sistemas como Punica e S-LoRA demonstraram que milhares de especializações podem compartilhar o mesmo modelo-base com ganhos substanciais de eficiência, tornando multi-tenancy e troca dinâmica uma realidade de sistemas, não apenas uma possibilidade teórica [2][3].

Variantes posteriores atacam limites diferentes. QLoRA reduz a memória do modelo-base por quantização [4]; DoRA separa magnitude e direção [5]; LoRA+ usa taxas de aprendizado distintas para as matrizes [6]; PiSSA altera a inicialização por componentes singulares [7]. Essas técnicas ampliam o espaço de projeto, mas também aumentam a quantidade de parâmetros de compatibilidade e proveniência que precisam ser conhecidos para reproduzir ou autorizar uma adaptação.

3. Eficiência, modularidade e a formação de uma supply chain

Um adaptador pequeno é mais fácil de distribuir, versionar e substituir do que uma cópia completa do modelo. Essa característica permite catálogos por domínio, personalização por cliente, atualização local e experimentos rápidos. Também permite que provedores mantenham uma única base em GPU enquanto selecionam adaptadores por requisição. Punica relatou maior throughput multi-tenant com pequeno overhead por token, enquanto S-LoRA mostrou serving escalável de milhares de adaptadores por paginação unificada e kernels especializados [2][3]. Esses resultados sustentam o valor de engenharia, mas não demonstram isolamento de segurança ou governança do ciclo de vida.

A modularidade cria uma supply chain própria. Um adaptador passa por criação, treinamento, avaliação, empacotamento, publicação, descoberta, download, resolução de dependências, armazenamento, carregamento, composição, ativação, uso, atualização e revogação. Cada etapa pode introduzir erro, desatualização, substituição, conflito de versão ou manipulação. O arquivo pode ser pequeno, mas seu efeito comportamental não é proporcional ao tamanho.

O vínculo com o modelo-base é especialmente importante. Um adaptador foi produzido para uma combinação de arquitetura, revisão de pesos, tokenizer, quantização, módulos-alvo, posto, escala e convenções de carregamento. Compatibilidade sintática não demonstra equivalência semântica. Uma carga que “funciona” pode ainda produzir regressão, degradação de alinhamento ou comportamento não avaliado, principalmente quando a base ou o runtime mudou desde a avaliação original.

4. Da alteração comportamental ao risco agentivo

Estudos sobre fine-tuning mostram que a personalização pode comprometer mecanismos de segurança mesmo sem intenção maliciosa. Qi et al. observaram degradação de alinhamento com poucos exemplos adversariais e também efeitos menores com conjuntos benignos [8]. Esses resultados não permitem concluir que toda LoRA degrada segurança, mas invalidam a suposição de que o alinhamento da base permanece automaticamente preservado após customização.

No ecossistema de compartilhamento, LoRATK demonstrou que um backdoor pode ser incorporado a um LoRA que mantém utilidade de tarefa e pode ser combinado, sem novo treinamento, com adaptadores downstream [9]. Trabalho posterior sobre detecção no espaço de pesos mostrou que estatísticas das matrizes podem ajudar a identificar adaptadores envenenados em um conjunto experimental específico, mas uma acurácia elevada naquele conjunto não constitui detector universal [10]. A defesa deve combinar análise de artefato, avaliação comportamental, proveniência e monitoramento, em vez de depender de um único sinal.

O risco de composição é ainda mais difícil. Colluding LoRA apresentou adaptadores que parecem benignos isoladamente, mas cuja composição degrada a segurança sem depender de um gatilho textual específico [11]. Isso expõe uma limitação combinatória: aprovação individual não implica aprovação do conjunto. Se um runtime permite composição arbitrária, a unidade de avaliação precisa incluir a configuração efetiva — base, adaptadores, ordem, escalas, política, ferramentas e contexto de execução.

Figura 2 — Da adaptação ao efeito agentivo
Figura 2 — Da adaptação ao efeito agentivo. A atualização de comportamento torna-se risco operacional quando atravessa planejamento, seleção de ferramenta, delegação e ação. A autoridade do agente deve permanecer limitada independentemente do adaptador ativo. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.

5. Cinco superfícies que precisam ser governadas

5.1 Identidade e compatibilidade

O identificador “nome do adaptador” é insuficiente. Uma decisão verificável deveria considerar digest do artefato, proveniência, identidade exata da base, tokenizer, quantização, módulos-alvo, posto, escala, formato, runtime e política aplicável. Esta é uma propriedade candidata SGAEIA, não um requisito normativo aprovado.

5.2 Composição

Adaptadores aprovados separadamente não tornam sua soma, fusão, empilhamento ou roteamento automaticamente aprovados. A composição precisa ser tratada como configuração nova, com avaliação proporcional ao risco e limites para explosão combinatória. O objetivo não é testar toda combinação possível, mas impedir que ausência de teste seja interpretada como autorização.

5.3 Supply chain e detecção

Assinatura e hash ajudam a provar origem e integridade, mas não provam comportamento seguro. Scanning de pesos pode aumentar a capacidade de triagem; testes comportamentais podem revelar gatilhos conhecidos; avaliação de ferramentas pode medir ações proibidas; evidência de execução pode apoiar investigação. Nenhuma dessas técnicas, sozinha, elimina backdoors desconhecidos ou efeitos emergentes.

5.4 Isolamento multi-tenant

O compartilhamento do modelo-base e da infraestrutura de GPU aumenta eficiência, mas requer isolamento entre identidade do tenant, adaptador resolvido, cache, contexto, telemetria e autoridade. Uma falha de roteamento não deve permitir que a requisição de um tenant use o adaptador de outro. Da mesma forma, uma otimização de batching não deve apagar a capacidade de demonstrar qual configuração efetivamente processou cada requisição.

5.5 Revogação distribuída

Revogar um adaptador em um registro central não garante que nós edge, caches ou workers particionados deixaram de usá-lo. Sistemas parcialmente desconectados precisam de validade temporal, políticas de fail-closed ou degradação segura e evidência de convergência. O tempo entre a decisão de revogar e a última execução autorizada é uma métrica de exposição, não apenas um detalhe operacional.

Figura 3 — Ciclo de vida e superfície de ataque de adaptadores
Figura 3 — Ciclo de vida e superfície de ataque de adaptadores. Segurança precisa acompanhar treinamento, distribuição, resolução, carga, composição, execução, observação e revogação. A figura mostra propriedades públicas de alto nível, não mecanismos internos do SGAEIA. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.

6. Propriedades candidatas para investigação no SGAEIA

O SGAEIA já trata identidade resolvida de artefatos, substituição, autoridade limitada, quarentena, revogação e Evidence-as-Code em nível geral. LoRA não deve ser declarada automaticamente uma lacuna arquitetural. Ela oferece um domínio concreto para confirmar, especializar e testar essas propriedades. Qualquer incorporação normativa exige o processo Research-to-Architecture e aprovação do proprietário.

As seguintes propriedades formam uma agenda de pesquisa não normativa:

  1. Vínculo exato: a decisão de carga deve referenciar a identidade efetiva do adaptador e de sua base, não apenas nomes ou versões declaradas.
  2. Não amplificação de autoridade: um adaptador pode alterar competência ou estratégia, mas não ampliar o conjunto de ações autorizadas.
  3. Aprovação sensível à composição: autorização individual não é transitiva para combinações.
  4. Invalidação por substituição: trocar base, tokenizer, quantização, runtime ou política relevante invalida assurance anterior até reavaliação.
  5. Isolamento por tenant e contexto: seleção e execução não devem atravessar fronteiras de tenant, sessão ou política.
  6. Revogação temporalmente limitada: a exposição residual precisa de prazo máximo e tratamento explícito de nós offline.
  7. Evidência correlacionável: seleção, resolução, carga, composição, decisão de política e ação consequente devem poder ser relacionadas sem expor conteúdo desnecessário.
Figura 4 — Governança verificável de adaptadores
Figura 4 — Governança verificável de adaptadores. Identidade, composição, autoridade, isolamento, revogação e evidência formam uma cadeia de propriedades candidatas. Elas são hipóteses de pesquisa e não arquitetura normativa aprovada. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.

7. O que ainda precisa ser demonstrado

A literatura já cobre eficiência, serving multiadapter, degradação de alinhamento, backdoors, detecção e ataques de composição. Também há propostas em que agentes selecionam LoRA como ferramentas especializadas [12]. A oportunidade científica não está em repetir que adaptadores podem ser perigosos, mas em medir como identidade, autoridade, composição e revogação interagem quando agentes usam ferramentas em topologias distribuídas.

Um paper derivado poderia perguntar: quanto um adaptador benigno, malicioso, incompatível ou composto altera decisões de ferramenta sob limites de autoridade? Quais controles reduzem ação proibida sem destruir utilidade? Quanto tempo de exposição resta depois da revogação em nós conectados, atrasados ou offline? Para responder, seriam necessários um harness reproduzível, bases e adaptadores controlados, cenários isolados e compostos, baselines, ablações e métricas como taxa de ação proibida, attack success rate, utilidade legítima, falsos positivos e negativos, latência de detecção, tempo de revogação e exposição residual.

Até que esses experimentos existam, não é legítimo afirmar que as propriedades propostas tornam agentes seguros ou que o SGAEIA reduz empiricamente o risco. O resultado atual é uma síntese técnica, uma delimitação de problema e uma agenda de pesquisa. Essa honestidade de estado é parte da contribuição.

8. Valor para três comunidades

Para engenharia de software, LoRA explicita que dependências comportamentais precisam de versionamento, compatibilidade, testes de composição, observabilidade, rollback e gestão de configuração. Para AI/ML, o tema conecta eficiência de adaptação a preservação de alinhamento, avaliação de utilidade e análise de efeitos por camada, posto, quantização e base. Para cibersegurança, cria uma superfície que combina supply chain, backdoors, detecção, isolamento multi-tenant, least privilege, resposta a incidentes e revogação distribuída.

O ponto de encontro é a configuração executada. Não basta saber qual modelo foi solicitado ou qual adaptador foi declarado. Assurance depende de identificar o que foi resolvido, carregado, combinado e efetivamente usado; qual política autorizou a execução; e quais ações resultaram dela. Essa cadeia transforma observabilidade em evidência apenas quando preserva contexto, integridade e significado.

9. Conclusão

LoRA continua sendo uma das técnicas mais importantes para adaptação eficiente de modelos. Sua decomposição de baixo posto reduz custos e tornou viáveis personalização, catálogos de especializações e serving multi-tenant. Em agentes de AI, porém, a mesma modularidade cria uma dependência comportamental capaz de influenciar decisões e ações consequentes.

A resposta não é abandonar adaptadores, nem presumir que assinatura, scanning ou avaliação isolada resolvam o problema. É governar identidade e compatibilidade, limitar autoridade fora do modelo, avaliar composições, isolar tenants, propagar revogações e preservar evidência correlacionável. Para o SGAEIA, LoRA é inicialmente confirmação e especialização de propriedades existentes, além de uma oportunidade de pesquisa. A passagem de oportunidade para arquitetura normativa ou claim de segurança dependerá de gates, experimentos e evidência.

Bibliography / References

[1] Hu, E. J. et al. “LoRA: Low-Rank Adaptation of Large Language Models.” ICLR, 2022. https://arxiv.org/abs/2106.09685. DOI: 10.48550/arXiv.2106.09685.

[2] Chen, L. et al. “Punica: Multi-Tenant LoRA Serving.” MLSys, 2024. https://proceedings.mlsys.org/paper_files/paper/2024/hash/054de805fcceb78a201f5e9d53c85908-Abstract-Conference.html.

[3] Sheng, Y. et al. “S-LoRA: Serving Thousands of Concurrent LoRA Adapters.” MLSys, 2024. https://proceedings.mlsys.org/paper_files/paper/2024/hash/906419cd502575b617cc489a1a696a67-Abstract-Conference.html.

[4] Dettmers, T. et al. “QLoRA: Efficient Finetuning of Quantized LLMs.” NeurIPS, 2023. https://arxiv.org/abs/2305.14314.

[5] Liu, S.-Y. et al. “DoRA: Weight-Decomposed Low-Rank Adaptation.” ICML, 2024. https://arxiv.org/abs/2402.09353.

[6] Hayou, S.; Ghosh, N.; Yu, B. “LoRA+: Efficient Low Rank Adaptation of Large Models.” ICML, 2024. https://arxiv.org/abs/2402.12354.

[7] Meng, F.; Wang, Z.; Zhang, M. “PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models.” NeurIPS, 2024. https://arxiv.org/abs/2404.02948.

[8] Qi, X. et al. “Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!” ICLR, 2024. https://arxiv.org/abs/2310.03693.

[9] Liu, H. et al. “LoRATK: LoRA Once, Backdoor Everywhere in the Share-and-Play Ecosystem.” Findings of EMNLP, 2025. https://aclanthology.org/2025.findings-emnlp.1253/. DOI: 10.18653/v1/2025.findings-emnlp.1253.

[10] Puertolas Merenciano, D. et al. “Weight Space Detection of Backdoors in LoRA Adapters.” 2026. https://arxiv.org/abs/2602.15195.

[11] Ding, S. “Colluding LoRA: A Composite Attack on LLM Safety Alignment.” 2026. https://arxiv.org/abs/2603.12681.

[12] Shekar, P. C.; Krishnan, A. “Adaptive Minds: Empowering Agents with LoRA-as-Tools.” 2025. https://arxiv.org/abs/2510.15416.

[13] Biderman, D. et al. “LoRA Learns Less and Forgets Less.” TMLR, 2024. https://arxiv.org/abs/2405.09673.

[14] Luong, H.-C.; Chen, L. “Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models.” Findings of ACL, 2026. https://aclanthology.org/2026.findings-acl.1732/. DOI: 10.18653/v1/2026.findings-acl.1732.

About the Author

Aridio Silva é pesquisador independente no Brasil, dedicado à arquitetura, segurança, governança e confiabilidade de sistemas de inteligência artificial autônomos e distribuídos. Sua pesquisa concentra-se em Agentic AI, Multi-Agent Systems, Edge AI, AI Security, Zero Trust, Security-by-Design, AI Governance, Spec-Driven Development e continuous security assurance. É criador e pesquisador responsável pelo SGAEIA — Secure Governed Autonomous Edge Intelligence Architecture, iniciativa de pesquisa que investiga fundamentos arquiteturais para sistemas autônomos de AI seguros, governados, auditáveis e confiáveis em ambientes distribuídos de edge e cloud.

Research & Project Resources

  1. ORCID: https://orcid.org/0009-0008-2411-6995
  2. Google Scholar: https://scholar.google.com/citations?user=rPn5O48AAAAJ
  3. Zenodo — SGAEIA Community: https://zenodo.org/communities/sgaeia
  4. OpenAIRE: https://explore.openaire.eu/search/find?fv0=Aridio%20Silva&f0=q
  5. Medium: https://medium.com/@aridiosilva
  6. DEV Community: https://dev.to/aridiosilva
  7. GitHub: https://github.com/aridiosilva
  8. LinkedIn: https://www.linkedin.com/in/aridio-silva-74997111/
  9. Homepage: https://aridiosilva.com
  10. SGAEIA Homepage: https://aridiosilva.com/sgaeia
  11. SGAEIA LinkedIn: https://www.linkedin.com/company/sgaeia/

Figures

A capa não é numerada. As Figuras 1–4 são ilustrações conceituais públicas, em alta resolução, com versões PT e EN, crédito visível e metadados incorporados. Elas não expõem protocolos, algoritmos, máquinas de estado, políticas internas, limiares ou mecanismos privados do SGAEIA.

License

Exceto quando indicado de outro modo, o texto e as ilustrações conceituais originais deste artigo são licenciados sob a Creative Commons Attribution 4.0 International License (CC BY 4.0).

© 2026 Aridio Silva. É permitido compartilhar e adaptar esta obra para qualquer finalidade, desde que seja atribuída a autoria adequada.

O artefato de software e pesquisa do SGAEIA permanece sujeito à sua própria licença Apache License 2.0.

Autonomous AI. Governed by Design. Trusted by Evidence.

Continuidade da série

Este trabalho é o SGAEIA Research Series — Article 19. A edição canônica em inglês e a edição em português estão disponíveis para leitura aberta na homepage do SGAEIA. A edição em português mantém o identificador DOI 10.5281/zenodo.23300168.

Citação sugerida

Silva, Aridio. (2026). LoRA em Agentes de AI: eficiência, riscos de segurança e governança de adaptadores. SGAEIA Research Series, Article 19. https://doi.org/10.5281/zenodo.23300168. Edição em português: https://aridiosilva.com/publications/artigo19/pt/. CC BY 4.0.