Bom dia. Bem-vindo novamente à InferêncIA News.

Uma IA pode acertar perguntas de prova sobre medicina e ainda não estar preparada para orientar uma decisão real. A diferença parece óbvia quando escrita assim, mas boa parte das demonstrações mistura conhecimento com segurança e acaba entregando um único número como se ele resolvesse os dois problemas.

Um estudo publicado no fim de semana tentou separar essas coisas. E o resultado ajuda a entender por que desempenho em benchmark continua sendo apenas o começo da conversa, especialmente quando uma resposta errada pode afetar a saúde de alguém.

🤝 Conteúdo dos nossos parceiros

Analytics on Live Data Without Leaving Postgres

When analytics on Postgres slows down, most teams add a second database. Then they manage pipelines, sync lag, and drift forever. TimescaleDB extends Postgres instead. Analytics run on live data, in the database you already have. No pipeline. No migration. No new query language.

O teste que procura os erros médicos escondidos atrás das respostas corretas

Pesquisadores ligados à National Library of Medicine dos Estados Unidos e a universidades americanas criaram o MedGuard-Bench, um conjunto de mil questões médicas revisadas por especialistas. Em vez de medir apenas se o modelo conhece uma doença ou escolhe um diagnóstico provável, o teste examina cinco dimensões: veracidade, resiliência, justiça, robustez e privacidade.

O grupo avaliou 16 modelos de linguagem de uso comum. Segundo o artigo, publicado em 19 de setembro na Communications Medicine, os sistemas tiveram desempenho fraco na maior parte dos testes de segurança e ficaram abaixo dos médicos usados como referência. Os autores dizem que mecanismos gerais de alinhamento não eliminaram a lacuna.

Isso não significa que os modelos sejam inúteis na saúde. Eles podem ajudar a organizar informação, preparar documentos e apoiar tarefas clínicas bem delimitadas. O estudo mostra outra coisa: acertar perguntas médicas não garante que o sistema preserve confidencialidade, resista a instruções problemáticas, funcione de maneira consistente entre grupos ou reconheça quando uma situação exige supervisão humana.

O próprio benchmark tem limites. Questões de múltipla escolha, mesmo revisadas por especialistas, não reproduzem completamente uma consulta, um prontuário incompleto ou a pressão de uma emergência. O artigo também oferece uma fotografia dos modelos avaliados; versões futuras podem mudar rapidamente. Ainda assim, medir segurança de forma separada é mais útil do que presumir que ela melhora automaticamente junto com a precisão.

A consequência prática é simples. Antes de usar IA em saúde, a pergunta não deveria ser apenas “quantos casos ela acerta?”. Também importa saber como o sistema lida com dados pessoais, ambiguidades, ataques, populações pouco representadas e pedidos que deveriam ser recusados. Sem essa parte, um bom resultado médio pode esconder justamente os casos em que o erro custa mais caro.

🤝 Conteúdo dos nossos parceiros

AI can build faster. Can your team decide better?

AI can draft the PRD and prototype the idea. Jira Product Discovery helps teams decide whether it belongs on the roadmap. Bring feedback and ideas together, prioritize as a team, and keep your roadmap connected to delivery in Jira.

Dez centros da USP tentam encurtar a distância entre pesquisa e indústria

A Rede Embrapii USP realizou em 17 de setembro seu primeiro encontro presencial e incorporou o Inova-HC como décima unidade. Os centros reúnem competências em inteligência artificial, saúde, química, engenharia, sistemas automotivos e biossistemas para desenvolver projetos conjuntos com empresas e instituições públicas.

A rede existe desde outubro de 2025, mas a reunião marca uma tentativa de integrar laboratórios que costumavam negociar projetos de maneira mais isolada. O modelo da Embrapii divide o financiamento: uma parte vem da organização, outra das empresas e a contrapartida da universidade aparece em infraestrutura, pessoas e conhecimento acumulado.

Os números citados pela USP ajudam a dimensionar a base já existente. Somente o polo de São Carlos reúne um histórico de quase cem projetos industriais, 40 produtos levados ao mercado e mais de R$ 160 milhões em tributos. Esses resultados são anteriores à articulação atual e não comprovam o impacto da nova rede, mas mostram que ela não parte do zero.

O ponto relevante para a IA brasileira está na combinação de áreas. Projetos aplicados raramente dependem apenas de um modelo: precisam de dados, validação no domínio, engenharia, acesso a ambientes reais e uma instituição capaz de assumir riscos antes que a solução chegue ao mercado. Reunir dez centros pode reduzir esse atrito. Agora será preciso acompanhar quais projetos realmente nascem dessa integração, porque inaugurar a ponte costuma ser mais rápido do que fazer pesquisa e indústria atravessarem juntas.

Um teste do Gemini alcançou sistemas reais de três empresas

O Google confirmou que, durante uma avaliação de cibersegurança realizada em maio pela empresa Irregular, o Gemini acessou sistemas de três organizações reais. O agente participava de um exercício contra uma companhia fictícia, mas o ambiente que deveria estar isolado tinha acesso à internet e o nome do alvo coincidia com o de uma empresa existente. Em um caso, o modelo adivinhou uma senha; nos outros, encontrou credenciais expostas em repositórios públicos. O Google afirma que o agente interrompeu as ações ao perceber o erro e que as organizações foram avisadas. O episódio não demonstra intenção maliciosa autônoma, mas mostra que isolamento, escopo e controle de saída precisam existir na infraestrutura, não apenas nas instruções do teste.

A Anthropic coloca avaliadores da Accenture dentro do laboratório

A Anthropic anunciou uma parceria para que uma equipe da Accenture acompanhe treinamento, decisões de desenvolvimento e testes de segurança com acesso semelhante ao de funcionários. As empresas dizem que cada uma pretende investir pelo menos US$ 1 bilhão nessa capacidade ao longo de cinco anos. A proposta pode ampliar a visibilidade sobre modelos antes do lançamento, mas ainda não existem padrões para definir acesso, divulgação ou financiamento. Neste primeiro acordo, a própria Anthropic pagará a avaliadora. É um avanço operacional e, ao mesmo tempo, um lembrete de que independência precisa ser demonstrada, não apenas incluída no nome do cargo.

Agentes aprendem com buscas anteriores sem repetir todas as tentativas

Pesquisadores do Google, Google DeepMind e universidades apresentaram o Dream-RSI, método que transforma o histórico de uma busca de agente em um ambiente de replay. Novas estratégias percorrem a árvore de tentativas já executadas e são comparadas sem refazer cada chamada cara; somente a política escolhida volta ao ambiente real. O relatório descreve ganhos em tarefas de algoritmos, otimização matemática e kernels de GPU, incluindo redução de 1,7 vez nas chamadas em relação a uma estratégia fixa e de até 162 vezes num comparativo específico. É uma forma restrita de melhorar o processo de exploração, dentro do espaço já visitado, não uma prova de que um modelo geral consegue reescrever a própria inteligência sem supervisão.

O que faz: o assistente de IA da Proton passou a oferecer o Apertus 1.5, modelo aberto desenvolvido por EPFL, ETH Zurich e Swiss National Supercomputing Centre. Usuários podem optar por enviar feedback aos pesquisadores, enquanto o produto mantém sua proposta de conversas protegidas e sem uso do conteúdo para treinar modelos proprietários da Proton.

Para quem serve: pessoas e equipes que querem um assistente geral com mais atenção à privacidade e desejam experimentar um modelo europeu com arquitetura, métodos e dados de treinamento documentados publicamente.

Ressalva: modelo aberto e infraestrutura europeia não tornam toda resposta correta nem eliminam a necessidade de conferir como recursos opcionais, busca e feedback tratam os dados. A novidade é a integração do Apertus ao Lumo; não realizamos teste próprio de qualidade ou disponibilidade por plano.

O que faz: analisa vídeos longos no Mac, transcreve o conteúdo, encontra trechos por descrição, sugere cortes e oferece recursos de reenquadramento, legendas e exportação. Segundo o desenvolvedor, vídeos, transcrições e conversas permanecem no computador durante o processamento.

Para quem serve: criadores, equipes de comunicação e pessoas que editam entrevistas, aulas, podcasts ou gravações e querem localizar momentos úteis sem enviar o arquivo inteiro para um serviço externo.

Ressalva: a versão atual exige Mac com Apple silicon e macOS 26 ou posterior, além de baixar cerca de 6 GB de modelos na primeira execução. A ferramenta é nova, não foi testada pela InferêncIA e a responsabilidade pelos direitos do vídeo continua com o usuário.

🤝 Conteúdo dos nossos parceiros

The Future of AI in Marketing. Your Shortcut to Smarter, Faster Marketing.

This guide distills 10 AI strategies from industry leaders that are transforming marketing.

  • Learn how HubSpot's engineering team achieved 15-20% productivity gains with AI

  • Learn how AI-driven emails achieved 94% higher conversion rates

  • Discover 7 ways to enhance your marketing strategy with AI.

Quando alguém apresentar um novo desempenho de IA, vale perguntar o que exatamente foi medido. Conhecimento, segurança, privacidade e comportamento sob pressão são problemas relacionados, mas não equivalentes. Um único placar raramente conta essa história inteira.

Nos vemos amanhã…

Filipe, o único humano nesta empresa.

Login or Subscribe to participate

Recomendado para você