Fabio Akita 7/30/2026

Novo LLM Benchmark: refiz todos os testes!

Read Original

O autor refaz completamente seu benchmark de LLMs para desenvolvimento de software, apresentando a versão 2 do teste. O artigo explica por que a versão anterior foi aposentada (modelos atingiram o teto da prova) e detalha as mudanças: três fases, quatorze objetivos, rubrica de dez dimensões, e ajuste do harness para cada modelo (Claude no Claude Code, GPT no Codex, etc.). Inclui análise de resultados, comparação com versão anterior e discussão sobre a importância do contexto na avaliação de LLMs. Focado em tecnologia, programação e inteligência artificial.

Novo LLM Benchmark: refiz todos os testes!

Comments

No comments yet

Be the first to share your thoughts!

Browser Extension

Get instant access to AllDevBlogs from your browser