
Petals permite rodar LLMs grandes em casa via rede P2P de GPUs
O Petals é um projeto de código aberto que permite rodar modelos de linguagem de grande porte (LLMs) em casa, usando uma abordagem peer-to-peer inspirada no BitTorrent. A ideia é simples: cada participante carrega uma parte do modelo em sua GPU e se junta a uma rede distribuída que serve as demais partes.
Modelos suportados
A plataforma suporta modelos como Llama 3.1 (até 405B parâmetros), Mixtral (8x22B), Falcon (40B+) e BLOOM (176B). A inferência em single-batch atinge até 6 tokens/segundo para Llama 2 (70B) e até 4 tokens/segundo para Falcon (180B) - velocidade suficiente para chatbots e aplicações interativas.
Flexibilidade além de APIs tradicionais
Diferente de APIs clássicas de LLMs, o Petals permite usar qualquer método de fine-tuning e sampling, executar caminhos personalizados pelo modelo e inspecionar seus hidden states. O projeto combina a conveniência de uma API com a flexibilidade do PyTorch e da biblioteca Transformers da Hugging Face.
Como participar
É possível testar diretamente no Google Colab ou contribuir com a própria GPU para a rede. O projeto faz parte do workshop de pesquisa BigScience e tem desenvolvimento ativo via Discord.