Estudo mostra que LLMs geram codigo RTL funcional mas inseguro quando a especificacao nao menciona seguranca explicitamente
Pesquisadores criaram o SECRTL-GEN, benchmark com 392 tarefas de geracao de codigo de hardware (RTL) em Verilog, SystemVerilog, VHDL e Python que testa correcao funcional e seguranca separadamente. Modelos de fronteira passam em 73% a 79% dos testes funcionais mas apenas 14% a 35% dos testes de seguranca, e modelos funcionalmente melhores nao sao necessariamente mais seguros -- um framework auxiliar, o RTL-Obliger, eleva a taxa combinada de aprovacao para 61,6% inferindo obrigacoes de seguranca implicitas a partir da propria especificacao.
Fonte ↗