Bom dia. Bem-vindo novamente à InferêncIA News.
Hoje vamos começar com alguns conteúdos mais densos que planejo postar por aqui.
Este conteúdo é voltado para uma análise mais aprofundada de temas relevantes que estão em alta.
O Astra ultrapassou o nível crítico de capacidade cibernética

Os novos GPT-6 Sol e Luna ficaram mais baratos para executar tarefas nos testes da Artificial Analysis. O Sol custou cerca de metade do GPT-5.6 Sol por tarefa no Intelligence Index. O Luna ficou aproximadamente 60% mais barato que seu antecessor.

É uma queda relevante. Só que, ao olhar os resultados com mais atenção, aparece uma história menos simples que “modelo novo, melhor e mais barato”.
O custo citado é calculado para as tarefas do Intelligence Index da Artificial Analysis. Ele considera preços de tokens e o consumo registrado durante aquelas avaliações. Não é uma previsão direta da conta de toda empresa ou pessoa que use os modelos.
E há outro detalhe: os dois modelos usaram um pouco mais de tokens de saída por tarefa que as versões anteriores. A economia, portanto, veio principalmente da redução de preço dos tokens, não de uma redução no volume gerado.
O desempenho também variou conforme a tarefa.
No Coding Agent Index da Artificial Analysis, o Sol avançou dois pontos em relação ao GPT-5.6 Sol. O Luna recuou dois pontos frente ao GPT-5.6 Luna. Em automação e Terminal-Bench, os dois tiveram algum avanço.
Já nas avaliações de trabalho profissional, houve sinais menos favoráveis. No GDPval-AA, os resultados de ambos caíram.
O Luna também recuou no AA-Briefcase, que avalia projetos de conhecimento de longo prazo.

A equipe da Artificial Analysis relacionou parte dessas quedas a respostas mais curtas, que deixaram de incluir alguns elementos pedidos nos critérios de avaliação.
Essa observação importa porque uma resposta pode parecer boa numa leitura rápida e ainda estar incompleta para a tarefa. Em um resumo, uma proposta ou um documento de trabalho, deixar de fora um requisito pode significar mais revisão para quem pediu ajuda.
Os resultados sobre alucinação também pedem contexto. No teste AA-Omniscience, os dois modelos tiveram taxas menores que seus antecessores. No caso do Sol, porém, isso veio junto com uma queda na quantidade de perguntas respondidas: ele tentou responder 83% delas, contra 99% do GPT-5.6 Sol. Sua acurácia caiu de 59% para 54%.
Ou seja, uma taxa de alucinação menor não significa automaticamente que o modelo sabe mais ou resolve melhor qualquer problema.

Às vezes, ele reduz erros respondendo menos. Isso pode ser desejável em algumas situações, mas também muda a utilidade do sistema para quem precisa de cobertura ampla.
🤝 Conteúdo dos nossos parceiros
Product teams aren’t short on ideas. They’re missing a system.

Jira Product Discovery gives teams one place to capture customer feedback, prioritize ideas with consistent frameworks, and build living roadmaps everyone can align on. And when it’s time to build, those decisions connect directly to delivery in Jira, so everyone can see how the roadmap turns into real work.
Blu Dot surpasses 2,000% ROAS with self-serve CTV ads
Blu Dot used Roku Ads Manager to drive incredible results for its furniture sales event. Its strategy hinged on custom audiences and retargeting, where intent was strongest.
“Roku has been a top performer,” said Blu Dot’s Claire Folkestad. “We have seen…CPMs lower than any other CTV partner we've worked with.”
🤝 Conteúdo dos nossos parceiros
Hire Ava, the AI BDR built for enterprise
Ava is the first AI BDR to run outbound end to end, and you decide whether she runs autonomously or on copilot.
She finds leads or ingests accounts from your CRM, enriches them, sends personalized emails on behalf of your reps, follows up, handles replies and books meetings. Website visitor de-anonymization, intent signals, and a parallel dialer come built in.
A small team can manage her centrally for thousands of reps who never log in. Everything syncs two-way with Salesforce and HubSpot.
Ava runs outbound for companies like DoorDash and Grammarly, and one customer deploys her across 1,000+ reps. Ava is SOC 2 Type II audited, SSO and GDPR ready. Ava is how revenue teams grow pipeline without growing headcount.


Minha leitura é que o GPT-6 Sol e o Luna devem ser avaliados como opções com compromissos diferentes, não como uma atualização que melhora tudo ao mesmo tempo. O preço por tarefa caiu. Algumas avaliações avançaram. Outras recuaram, especialmente quando o trabalho exige respostas completas e consistentes.
Para escolher um modelo, vale olhar além do preço por milhão de tokens ou de uma nota geral. O que importa é o custo para obter uma entrega que realmente sirva: quanto retrabalho exige, se cobre todos os requisitos, quando recusa responder e como se comporta nos casos relevantes para sua equipe.
A análise da Artificial Analysis oferece bons sinais para comparação, mas continua sendo uma fotografia feita em avaliações específicas. O próximo passo para qualquer organização é testar com tarefas próprias e verificar se a economia aparece também no trabalho de verdade.
Nos vemos amanhã…
Filipe, o único humano nesta empresa.




