
Benchmark mede modelos compactos de IA rodando em celulares
Escopo do benchmark
A Artificial Analysis passou a manter um benchmark dedicado à inferência em escala de bolso: modelos de IA pequenos rodando localmente em celulares. Modelo pequeno, na definição adotada, é o que cabe em 8 GB de memória após quantização, incluindo o cache KV com contexto de 8K. Os testes rodam builds quantizadas a 4 bits ou menos via llama.cpp em dois aparelhos de 12 GB: iPhone 17 Pro e Galaxy S26 Ultra. Mais modelos, quantizações, dispositivos e frameworks de inferência estão previstos. A iniciativa se enquadra num espectro de potência: celulares em 2–20 W, laptops e workstations em 15 W–2 kW e sistemas de datacenter em 700 W–600 kW, com a marcação “Late 2026” junto a essas faixas.
Validação da medição
Os dados de inferência são coletados em parceria com a Liquid AI, com medição feita nos próprios dispositivos. A Artificial Analysis declara ter validado de forma independente o processo de medição da Liquid AI.
Como a inteligência é medida
A nota de inteligência é a média simples de cinco avaliações escolhidas para representar uso real em dispositivos móveis: BFCL (subconjunto de chamada de ferramentas), IFBench (seguimento de instruções), AA-Omniscience (conhecimento, com taxa separada de não alucinação), GPQA Diamond (raciocínio científico) e MATH-500 (raciocínio quantitativo). O contexto é limitado a 16K tokens, com variantes de 64K de contexto e de tempo máximo de um minuto.
Desempenho de inferência
O tempo de geração de ponta a ponta conta os segundos para processar um prompt de 1.024 tokens e gerar uma resposta de 256 tokens. Segundo a Artificial Analysis, esse tempo depende do hardware e da arquitetura do modelo e não inclui o efeito de verbosidade nem a tendência de usar mais ou menos turnos. Velocidade de saída e memória de pico completam o quadro. Há ainda a métrica de eficiência de tokens: os “context budget overruns”, gerações que pararam no limite de 16K tokens em vez de terminar, somadas em todas as avaliações do modelo - menor é melhor.
Cobertura atual
A visualização exibe 23 dos 39 modelos, de organizações como Nanbeige, Liquid AI, Ornith AI, Alibaba, Google, TII UAE, InclusionAI, AI9Stars, IBM, OpenBMB, NVIDIA e Prism ML. Parte dos modelos também tem nota no índice completo da Artificial Analysis, como Gemma 4 31B (Reasoning), LFM2.5-2.6B, Ling 3.0 Tiny, Ministral 3 3B e 8B, Qwen3.5 9B (Reasoning), Qwen3.6 27B (Reasoning) e Qwen3.6 35B A3B (Reasoning). Modelos que não couberam no aparelho ou excederam o limite de tempo aparecem com medições omitidas.