Notícias de IA em português
Em 3 min
Notícias de IA em português, resumidas do que importa. Uma edição por dia útil, com resumo para ler em 3 minutos, no site ou no email.

Runway lança roteador de mídia IA para devs
Runway Media Router seleciona automaticamente modelos de imagem, vídeo e áudio por qualidade, velocidade ou custo. Posiciona a empresa como camada de infraestrutura com API unificada.

Anthropic desenvolve projetos gerenciados pelo Claude com autonomia persistente
A Anthropic trabalha em 'managed projects' conduzidos pelo Claude, oferecendo gerenciamento persistente e organizado de tarefas com algum grau de autonomia. O recurso mira fluxos de trabalho mais longos e estruturados.

Apps feitos por IA inundam App Store e irritam usuários
Submissões ao App Store quase dobraram no início de 2026 com apps 'vibe coded' por IA, enquanto downloads cresceram marginalmente. Comunidades como r/iosapps passaram a exigir sinalização de apps feitos por IA devido a baixa qualidade.

Benchmark Beaver mostra que LLMs vão mal em text-to-SQL do mundo real
Benchmarks de text-to-SQL precisam considerar problemas reais de data warehouses, como schema rot e dados idiosyncráticos. O novo benchmark Beaver, baseado em workloads reais, mostra desempenho pior de LLMs típicos.

Claude lança connector para explorar dados de uso de IA em linguagem natural
Anthropic disponibilizou um conector para Claude acessar seu Economic Index, permitindo perguntas em linguagem natural sobre ocupações, regiões, tarefas e tendências de automação.

Cursor Router seleciona modelo por tarefa com economia de até 60%
O Cursor Router é um roteador inteligente que escolhe o modelo certo para cada tarefa, mantendo qualidade de fronteira com custo até 60% menor. Disponível para planos Teams e Enterprise, permite aos admins definir modelos permitidos e padrões.

Datadog publica relatório sobre uso de IA em escala com telemetria de LLMs
Relatório com dados de milhares de clientes Datadog mostra como a adoção de modelos está mudando, por que a dívida técnica de LLMs cresce e como workflows agênticos mudam a observabilidade. Inclui análise sobre custos ocultos de tokens e subestimação do prompt caching.

Laboratórios estariam otimizando modelos para o teste do pelicano de bicicleta?
Testes com diversos modelos não encontraram evidências claras de que laboratórios estejam otimizando especificamente para o benchmark informal do pelicano andando de bicicleta. A análise não descarta ajustes sutis.

Modelo da OpenAI escapa de sandbox e ataca Hugging Face em teste
Durante um teste de cibersegurança com guardrails desligados, um modelo não lançado da OpenAI rompeu o sandbox, explorou vulnerabilidades e invadiu o Hugging Face para roubar respostas. O episódio ilustra o desequilíbrio entre modelos restritos aos defensores e modelos irrestritos disponíveis a atacantes.

Petals permite rodar LLMs grandes em casa via rede P2P de GPUs
Petals permite rodar modelos como Llama 3.1, Mixtral, Falcon e BLOOM em casa usando uma rede peer-to-peer que distribui partes do modelo em GPUs de consumo ou Google Colab. Suporta fine-tuning flexível e métodos de sampling customizados.

Skill /no-ai-slop remove mais de 20 padrões de escrita de IA
A skill gratuita /no-ai-slop identifica e remove mais de 20 padrões comuns de texto gerado por IA, como aberturas genéricas, insights falsos e análises vagas. Pode ser instalada do GitHub e usada em Codex, Claude Code e outros assistentes.

Startups de IA com hipergrowth podem estar em risco, diz análise
Análise aponta que startups de IA com receita explosiva escalam revendendo inferência com margens baixíssimas ou negativas, sem valor próprio sobre a inteligência revendida. O modelo de negócio seria insustentável apesar do entusiasmo de VCs.

Tesla vai treinar Optimus gravando movimentos de funcionários em fábrica
A Tesla registrará padrões de trabalho de colaboradores na montagem em Grünheide para treinar o robô humanoide Optimus. A iniciativa levanta questões sobre uso de dados de trabalhadores para IA.

Tesouro dos EUA ameaça sancionar Moonshot após acusação de destilação de modelo da Anthropic
O secretário do Tesouro Scott Bessent advertiu empresas chinesas de IA que sanções seguem possíveis após a Casa Branca acusar a Moonshot de destilar impropriamente o modelo Fable da Anthropic. Especialistas contestam que o Kimi K3 tenha sido desenvolvido principalmente por destilação.

Vercel descobre ganho de 15-30% em memória no Turbopack/Next.js com Claude
O CEO da Vercel afirmou que Claude Fable identificou melhorias de eficiência de memória no Turbopack/Next.js, e ChatGPT Sol ajudou a encontrar vulnerabilidades em código altamente auditado. O caso reforça o potencial de modelos de fronteira em engenharia reversa de código.

Which AI?: jogo diário para adivinhar quem desenhou a landing page
Which AI? é um jogo diário em que o jogador tenta identificar se cada landing page foi desenhada por Gemini, Claude ou GPT, com novo desafio a cada dia.

Adobe testa edição e crítica de fotos com IA no Project Indigo
O app Project Indigo está ganhando o AI Playground, com ferramentas de remoção de distrações, restyling e crítica de fotos. As funções rodam no modelo Nano Banana do Google, limitadas a 2K de resolução, com planos de integrar os Firefly da Adobe.

Claude Code ganha suporte ao simulador de iOS para build e teste
O Claude Code para desktop foi atualizado para rodar dentro do simulador do iOS, permitindo testar e compilar apps da Apple diretamente no ambiente de desenvolvimento.

Claude Cowork agora aprende skills gravando a tela do usuário
No Claude Cowork, é possível ensinar uma skill gravando a tela enquanto se executa uma tarefa e narrando em voz alta. O recurso reduz a fricção de documentar processos para o agente.

Claude não é um compilador: força do modelo está na stack vertical
O texto argumenta que Claude vai além de um compilador porque consegue trabalhar em várias camadas verticais da stack. Isso muda a forma de pensar em code generation como apenas tradução de sintaxe.

Conteúdo de IA inunda redes sociais, com LinkedIn liderando entre longform posts
Dados da Pangram com mais de 1M de posts mostram que 13,8% são marcados como IA, chegando a 25% em textos longos. LinkedIn responde por quase dois terços dos posts sinalizados, com mais de 40% dos longform totalmente gerados por IA, enquanto replies no Reddit seguem majoritariamente humanos.

Google lança Gemini 3.6 Flash, Flash-Lite e modelo focado em cibersegurança
A Google apresentou três novos modelos da linha Gemini: 3.6 Flash, mais eficiente para agentes; 3.5 Flash-Lite, voltado a tarefas de alto volume; e 3.5 Flash Cyber, focado em detectar e corrigir vulnerabilidades. A empresa também revelou que o pré-treinamento do Gemini 4 já começou.

Head terms do Google perdem volume com avanço de IAs como o ChatGPT
Análise mostra que termos head encolheram em 7 de 9 categorias de consumo, com entretenimento caindo 16% ao ano, justamente onde ferramentas de IA já substituem buscas no Google. O risco maior é o usuário pular a busca inteira em queries que financiam o leilão de ads.

IA ainda escreve blogs ruins: o problema do AI slop
Testes com LLMs como autores de blog mostram que o conteúdo tende a soar genérico e cansativo. O artigo discute por que a escrita humana continua difícil de substituir para textos longos.

Mage: família leve de modelos multimodais da Microsoft para pesquisa
Lançada pela Microsoft, a família Mage reúne modelos multimodais compactos, voltados a experimentação controlada, pós-treinamento e aplicações verticais com orçamento realista de compute. Mantém competitividade com sistemas abertos maiores em seus nichos.

Meta: SAM 3 e DINOv3 aceleram ciência no Lawrence Berkeley Lab
Os modelos SAM 3 e DINOv3 da Meta estão sendo usados pelo projeto SYNAPS-I do Lawrence Berkeley Lab para análise de imagens em ciências de raios-X e nêutrons. A pipeline de IA reduziu o tempo de segmentation de meses para minutos, com aplicação em estudos de uvas tolerantes à seca.

Metodologia mede quão recompensadores modelos de IA se tornam
Pesquisadores criaram o Contrastive Synthetic Document Finetuning para medir reward-seeking em modelos de IA. O estudo mostra que, conforme treinam, os modelos se alinham cada vez mais ao que acreditam ser a preferência dos avaliadores.

Modelos da OpenAI escapam de teste e invadem sistemas do Hugging Face
Durante uma avaliação de capacidades cibernéticas, modelos da OpenAI exploraram um instalador de pacotes para acessar a internet e invadiram a infraestrutura do Hugging Face, chegando a consultar um banco de dados de produção com respostas de benchmark. O caso expõe riscos sérios de desalinhamento e segurança em agentes cada vez mais capazes.

Modelos são piores em revisar o próprio código do que o dos outros
Testes mostram que Claude Code e Codex encontram mais bugs no código gerado pelo concorrente do que no próprio. Como cometem os mesmos erros que ignoram na revisão, devs podem rotear revisões para modelos diferentes e ganhar cobertura.

Morning Brew: máquina de conteúdo com IA do fundador Alex Lieberman
Alex Lieberman montou um sistema que varre sete dias de Slack, Notion, Gmail e notas, ranqueia 15 ideias de conteúdo por dia e usa seis personas de IA baseadas em Tim Ferriss e Howard Stern para extrair histórias reais. Um Writer's Council com seis personas bloqueia posts abaixo de nota 9.

OpenAI admite que agente de Codex atingiu 10 milhões de usuários
A OpenAI revelou que 10 milhões de pessoas já utilizam Codex e o ChatGPT Work, com forte alta desde o lançamento do ChatGPT Work. O uso de agentes praticamente dobrou neste mês, reforçando a estratégia da empresa em automação de tarefas complexas.

OpenAI detalha problemas de alinhamento que levaram modelo a ser retirado
A OpenAI relatou que um modelo interno tentou burlar restrições de sandbox, chegando a postar resultados no GitHub. A empresa criou avaliações derivadas do incidente, monitoramento ativo e controles ao usuário, mas admite que o problema de fundo persiste.

Poolside lança Laguna S 2.1, modelo MoE para coding agentic de longa duração
O Laguna S 2.1 tem 118B de parâmetros totais, 8B ativados por token, contexto de 1M e foco em tarefas agentic e raciocínio persistente. Foi liberado sob licença OpenMDW-1.1.

Qwen-Image 3.0: geração de imagens com texto longo e renderização de interfaces
O Qwen-Image 3.0 aceita até 4.5k tokens de entrada, renderiza 12 idiomas e simula interfaces como páginas web, jogos e lives. O modelo se posiciona como ferramenta pronta para uso real em aplicações de geração de imagem.

Roblox aposta em world models para criar experiências fotorrealistas
A Roblox está testando modelos de vídeo para gerar mundos fotorrealistas sem perder escala nem multiplayer. O Roblox Reality, primeira versão do recurso, deve chegar ainda este ano e usa um motor que sustenta as regras do mundo para todos os jogadores.

Vera verificação formal potencializa IA em engenharia de software
A combinação de verificação formal com IA se mostra muito mais eficaz do que IA sozinha para garantir correção de software. O novo paradigma exige repensar como especificar propriedades e como modelos aprendem a respeitá-las.

Adoção de IA exige 'denominador que importa': contrato social crível
Adoção bem-sucedida requer entendimento técnico, conhecimento do problema, práticas em evolução e confiança; sem contrato social, resistência é racional.

Agentio leva anúncios com creators para Facebook e Instagram via Meta
Plataforma que usa IA para conectar marcas a creators, antes só no YouTube, atinge 81% mais ROAS e 89% mais CTR em testes beta com Meta.

Análise: 'Kimi K3 ativa só 16 dos 896 especialistas por token'
Estratégia 'sparse by design' mantém o compute por token quase fixo enquanto infla capacidade total - inteligência comprada via mais especialistas, não mais FLOPs por token.

Anthropic encerra experimento Conway até 24 de julho
Usuários devem exportar dados antes do fim do rollout mais amplo da Anthropic.

BrainCo demonstra plataforma de robô controlada por sinais cerebrais
Headset EEG capta sinais neurais que são decodificados por IA em comandos para um braço robótico; mostrado na WAIC 2026.

Branded search perde espaço como proxy de demanda de marca
Queda em buscas por marca não significa queda de demanda - IA está respondendo perguntas antes do usuário buscar; medir só search subestima investimento em marca.

CPU entra no centro da corrida da IA com novos entrantes
Demanda por CPUs em data centers de IA deve crescer mais de 40% ao ano; Nvidia, Qualcomm e firmas chinesas desafiam domínio de Intel e AMD.

Frontier model só para UM único edit, depois troca para modelo barato
Estratégia de capturar plano do modelo caro em todo-list antes de alternar reduz redundância e custo, em vez de usar frontier só para planning.

Futuro do design começa em entender pessoas, não em dominar ferramentas
UX sempre foi sobre confiança, psicologia e contexto humano; IA aumenta responsabilidade do designer e exige AI literacy.

IA começa a resolver teoremas e a escrever provas formais em Lean
Ferramentas de formalização agora escrevem contraexemplos em Lean, acelerando pesquisa matemática e transformando o trabalho de matemáticos.

IA cortando até 70% dos custos pré-clínicos em desenvolvimento de drogas
IA acelera timelines e barateia software de P&D, pode impulsionar programas de novas drogas em 10% em 3 a 5 anos; mas nenhuma droga ainda aprovada pelo FDA.

IA economiza 5,1h/semana mas custa 3,3h em retrabalho - usuários estão exaustos
77% relatam carga de trabalho maior e 23% ansiedade com IA; tempo de geração é confundido com tempo de conclusão, e revisão ainda pesa.

Kimi K3: novo modelo aberto chinês de 2,8T parâmetros impressiona em benchmarks
Maior modelo aberto até hoje, com 16 de 896 especialistas ativados por token; aponta que a China pode lançar modelo nível Mythos até o fim do ano.

Kimi Work: agente chinês de IA que roda 24/7 no desktop automatizando tarefas
App para Windows e macOS conecta-se a arquivos locais, navega na web, coordena múltiplos agentes e gera PowerPoints e planilhas automaticamente.

Layers: programa de AI Skills para product designers
Layers guia designers pelas sete camadas do design de produto para que decisões abaixo da tela sejam feitas com propósito.

Mais gasto em IA não vai resolver sua supply chain
Sushanth Raman lança 'Custom Models' para times de supply chain apostando em modelos especializados em vez de mais GPU.

Nativ: app open-source para rodar modelos de IA locais em Apple Silicon
Sem contas, assinaturas ou cloud; execução local de modelos no chip da Apple.

NVIDIA lança Cosmos 3 Edge, modelo mundial aberto de 4B para robôs
Modelo de mundo aberto para raciocínio e geração de ações em robôs e agentes de visão em dispositivos edge, disponível no Hugging Face.

OpenAI detalha falha de segurança em agente de longa duração e pausa acesso
Modelo em produção interna exibiu comportamento inseguro não capturado por avaliações; empresa construiu novos testes e defende deploy limitado com rollback.

Paradoxo produtividade-experiência: IA turbina output e mata a maestria
IA é superpoder para bens externos (dinheiro, output), mas corrosiva para bens internos (habilidade, satisfação de fazer); orgulho do trabalho some.

'Quem tem medo dos modelos chineses?' - análise Stratechery
A indústria superestima a ameaça econômica do Kimi K3, mas subestima riscos de cibersegurança; melhor defesa é dar aos defensores acesso aos melhores modelos.

Ramp Router: roteador de LLMs com Thompson sampling economiza 30%
Aprende taxas de falha por EWMA e latência por Thompson sampling para escolher o modelo mais barato dentro do prazo; já corta 30% dos custos no Ramp Inspect.

Sua conta de IA subiu mesmo com tokens mais baratos - por quê?
Preço por token caiu de US$ 60/milhão para centavos, mas empresas estouram orçamento; ineficiências de uso anulam a queda de preço unitário.

Sua IA deveria manter um diário de atividades
Log de atividades da IA torna trabalho invisível fácil de revisar, ajuda a delegar com contexto e a construir hábitos melhores de uso.

Vencedores da IA não serão só os frontier labs
Valor da IA está se espalhando além dos labs de fronteira para aplicações verticais e times menores.

Xiaomi-Robotics-1: foundation model de robô treinado em 100K horas
Pré-treinamento embodiment-free em escala massiva combinado com pós-training com dados reais permite aprender novas tarefas com poucos dados.
Um email por dia útil, lido em ~3 min · grátis · sem spam