LLM Benchmark: Devo usar o que tem nota maior?
Explica por que a nota de um LLM em benchmarks não deve ser o único critério para escolha, destacando variáveis como prompt, contexto e execução.
Explica por que a nota de um LLM em benchmarks não deve ser o único critério para escolha, destacando variáveis como prompt, contexto e execução.
Análise da controvérsia sobre o modelo LLM Rio 3.5, acusado de plágio por misturar pesos de outros modelos sem crédito adequado.
Exploração do desenvolvimento de TUIs em Rust com Ratatui e Bubble Tea, usando LLMs para gerar código.
Guia prático sobre boas práticas essenciais para projetos de código aberto com LLM, focando em instalação, testes e documentação.
Widget Waybar em Rust para monitorar uso de planos de LLM (Claude, GPT, Z.AI, OpenRouter) no Omarchy.
Autor reflete sobre maratona de 500h usando LLMs para codar 100% do tempo, compartilhando resultados e lições.
Relato de uma imersão de 37 dias em 'vibe coding' usando LLMs e agentes de IA para construir e colocar 8 projetos reais em produção.
Análise sobre quais características de uma linguagem de programação seriam ideais para edição por LLMs, com exemplos e um protótipo gerado por IA.
Análise comparativa de LLMs (Claude Code, GPT 5.2, Kimi 2.5, Gemini 3.0, MiniMax) para desenvolvimento de software via prompts, concluindo que nenhum produz código perfeito sem expertise.
Análise prática do modelo de IA GLM 4.7 Flash, testando seu desempenho localmente e comparando ferramentas de execução como VLLM, LM Studio e Ollama.
Comparação de desempenho de LLMs (Claude Opus, GPT Codex, Gemini, open source) em um desafio de programação em Zig para criar um app de chat CLI.
Experiência prática usando 'vibe coding' e engenharia de contexto com LLMs para criar uma aplicação do zero em Next.js e TypeScript.
Resumo semanal de aprendizagens em tecnologia, focando em IA generativa, LLMs, Azure OpenAI e novidades de modelos como GPT-5 e Llama 2.