Modos de Modelo do Agente
Cada agente SuperSquad pode usar um de 5 modos de modelo para sua inteligência artificial. Os modos determinam de onde vem o LLM que o agente usa.
1. Proxy API (Existente)
O agente usa modelos via SuperSquad Proxy — uma camada que roteia requests para providers como OpenAI, Anthropic, Google, etc.
- Configuração: automático, selecione o modelo na tela do agente
- Billing: por token consumido
- Ideal para: quem quer simplicidade sem configurar infra
2. Local (Ollama) (Existente)
O agente roda modelos localmente na VM usando Ollama. Privacidade total, sem custos de API.
- Configuração: ative "Ollama" e escolha o modelo (ex:
llama3,mistral) - Billing: apenas o custo da VM
- Ideal para: privacidade total e modelos open-source
3. API Key Própria (Existente)
Use suas próprias API Keys diretamente nos providers — sem intermediário.
- Configuração: adicione env vars com suas keys (ex:
OPENAI_API_KEY) - Billing: direto com o provider
- Ideal para: quem já tem keys e quer controle total de custos
4. GPU Contratada (Fixa) — NOVO
O agente usa uma GPU dedicada reservada no marketplace com endpoint vLLM fixo.
- Configuração:
- Vá ao GPU Marketplace e reserve uma GPU
- Na tela do agente, selecione "GPU Contratada"
- Escolha o modelo a rodar (ex:
meta-llama/Llama-3.1-70B) - O endpoint vLLM é configurado automaticamente
- Billing: Preço base da GPU/hr + Tx de serviço (contínuo enquanto reservado)
- Ideal para: workloads constantes que precisam de latência garantida
5. Proxy Inteligente de GPU — NOVO
O agente usa um scheduler inteligente que auto-provisiona GPUs no marketplace sob demanda.
- Configuração:
- Na tela do agente, selecione "Proxy Inteligente GPU"
- Escolha o modelo desejado
- Defina a estratégia:
Mais Barato,Menor Latência, ouHíbrido - Defina um budget máximo/hr (opcional)
- Billing: Preço base da GPU/hr + Tx (apenas durante uso ativo)
- Ideal para: uso intermitente com budget controlado
Fallback entre modos
Os modos suportam cadeia de fallback automática:
| Se falhar... | Tenta... |
|---|---|
| GPU Contratada | → Proxy Inteligente GPU → Proxy API |
| Proxy Inteligente GPU | → Proxy API |
| Local (Ollama) | → Proxy API |
| API Key Própria | → Proxy API |
O fallback é transparente — o agente não percebe a troca.