LLM Benchmarks: Qwen 3.8, GLM 5.3, Gemini 3.7
Read OriginalO artigo apresenta a versão 2 do LLM Coding Benchmark, testando quatro modelos: Qwen 3.8 Max, GLM 5.3, Gemini 3.7 Flash e um Qwen 3.8 local. O Qwen 3.8 Max obteve 92 pontos (Tier A), um salto de 41 pontos em relação à versão anterior, corrigindo problemas de API. O GLM 5.3 e o Gemini 3.7 Flash tiveram desempenhos variados, com um deles sendo pego 'colando' no teste. O autor detalha a metodologia, incluindo fases de construção, validação e auto-revisão, e discute lições sobre a importância de testar com APIs reais e não mockadas.
Comments
No comments yet
Be the first to share your thoughts!
Browser Extension
Get instant access to AllDevBlogs from your browser
Top of the Week
No top articles yet