Llama 4 Scout com contexto longo
Meta Llama 4 Scout — MoE com contexto ultralongo
- Memória de vídeo
- 200 GB
- Instalação
- ~15 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O Scout é a variante da Meta pensada para contexto muito longo: documentos inteiros, repositórios, históricos completos. Precisa de acesso liberado no repositório de modelos antes do primeiro download.
Llama 4 Scout (Meta) servido via vLLM com API OpenAI-compatível — MoE com janela de contexto enorme (até ~10M tokens). IMPORTANTE: modelo GATED no Hugging Face → defina HF_TOKEN com acesso aprovado. Modelo grande: prefira múltiplas GPUs H100/H200; contexto longo consome muita VRAM.
Para que serve
- Analisar contrato ou processo inteiro sem fatiar
- Agente com memória longa de conversa
- Busca e resumo sobre base extensa de documentos
- Ecossistema Llama, com muita ferramenta compatível
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Llama 4 Scout e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Preciso pedir acesso ao modelo?
Sim, é um modelo com acesso controlado. Aceite os termos na sua conta do repositório e informe o token no template.
Quanta memória de vídeo?
Cerca de 200 GB, ou seja, um bloco de placas grandes.
Dá para usar contexto máximo desde o início?
Contexto muito longo consome memória extra. Comece menor e aumente conforme a placa aguentar.