O gateway de IA que mostra a conta.
Modelos locais — GPU on-prem — e de nuvem atrás de uma interface só, com auditoria, cota e proteção LGPD por projeto. Cada resposta chega com o que custou: tokens, tempo, tok/s e a infra que atendeu.
- Modelo local e de nuvem na mesma conversa, com troca no meio do caminho.
- Toda resposta reporta tokens, tempo, tok/s e onde rodou.
- Seu contexto vai só para o provedor que você escolher — na GPU de casa, não sai da rede.
- 21 provedores de nuvem no catálogo — 19 via BYOK, 2 por assinatura
- + GPU on-prem modelo local — contexto que não sai da rede
- 4 dialetos de API nativo · OpenAI-compat · Anthropic-compat · Responses
- 7 superfícies web · desktop · mobile · cli · workspace · bench · memória
Um gateway, não mais um chat
A pergunta que o ShvIA responde não é “qual modelo é melhor”. É “quem falou com qual modelo, com que contexto, quanto custou e onde isso rodou”. Ele fica entre quem trabalha e os provedores: aplica a política do projeto, desconta da cota do grupo, registra a requisição e devolve a resposta com o mostrador do lado.
- gateway
- Uma interface para vários provedores: GPU on-prem e nuvem via BYOK (sua chave, seu contrato).
- provedores
- Anthropic, OpenAI, xAI, Z.ai, Gemini, DeepSeek, Kimi, MiniMax, Llama, IBM, Groq, Mistral, Together, Fireworks, Novita, OpenRouter, Perplexity, Kilo e Hermes — mais a GPU da casa. Os modelos de cada um chegam por descoberta ao vivo, com a sua chave.
- assinatura
- Quem já paga OpenCode ou ChatGPT liga a própria assinatura no lugar de uma chave por token — o gateway fala o dialeto de cada um e a conta continua sendo a sua, no provedor.
- auditoria
- Log completo de requisição, tentativas de autenticação, tokens e desempenho.
- cota
- Limite por Grupo de Trabalho — Iniciante, Profissional, Expert, Admin. Diário, semanal e mensal, editáveis pelo administrador, com aviso antes de bater o teto.
- workspaces
- Pastas, arquivos e extração de texto para virar contexto da conversa.
- modo code
- Agente que lê, propõe diff, edita e roda comando na pasta local — cada operação com aprovação explícita.
- memória
- O que já foi decidido volta na conversa seguinte — e, com o ai-memory, atravessa agentes e máquinas em markdown que você lê sem o app.
- canais
- A mesma conversa pelo WhatsApp e pelo Telegram, com a mesma política e a mesma auditoria da tela.
- mcp
- Nas duas direções: o ShvIA consome servidores MCP e também se apresenta como um — com allowed_tools fechado por padrão.
- anna
- O nome da assistente do ShvIA. No terminal, o CLI
anna; na tela, a mesma voz.
O mostrador não mente
Telemetria não é enfeite: é informação de trabalho. Cada resposta sai com o recibo do lado — o número exibido é o número real da execução, em fonte mono e algarismos tabulares, para comparar linha a linha sem esforço.
E quando a resposta sai da GPU de casa, o recibo mostra a melhor linha possível: custo R$ 0,00.
| SHVIA · RECIBO DE INFERÊNCIA | #000481 |
| conversa | anna · operacional |
| infra | gpu-local |
| modelo | qwen3-coder:30b |
| esforço | médio |
| tokens entrada | 12.481 |
| tokens saída | 1.903 |
| tempo total | 28,4 s |
| velocidade | 67,0 tok/s |
| custo | R$ 0,00 |
| rodou na sua GPU — nada saiu da rede | |
|
exemplo layout do recibo — no app, cada linha vem da execução real | |
Caminho do dado
Do teclado à resposta, passando por um lugar só — e deixando rastro auditável.
- Você manda a pergunta e o contexto (arquivos do workspace, seleção de código).
- O gateway resolve o perfil de modelo, checa a cota do grupo e abre o registro de auditoria.
- A execução vai para a GPU on-prem — onde o contexto não deixa a rede — ou para um provedor de nuvem com a sua chave.
- A resposta volta com o recibo, e o registro fecha com os mesmos números.
Combos: o plano B decide antes do primeiro token
Um combo é uma fila de modelos com dono. Se o primário não responde — limite do provedor, indisponibilidade, chave vencida — o gateway passa para o próximo antes do primeiro token, na mesma conversa e com o mesmo contexto. Sem tela de erro, sem recomeçar.
- claude-sonnet-4-6 anthropic · nuvem limite do provedor
- qwen3-coder:30b gpu-local · on-prem atendeu no lugar
- deepseek-chat deepseek · nuvem na fila — não foi preciso
exemplo encadeamento ilustrativo — no app, o combo é montado por você e o recibo diz quem de fato atendeu
- seus combos
- Criados e editados no painel: a ordem, os modelos e o apelido da fila são do usuário, não do sistema.
- no seletor
- O combo aparece no seletor de modelos marcado com ⚡ — escolher a fila é tão simples quanto escolher um modelo.
- no recibo
- Cada resposta continua dizendo qual modelo e qual infra atenderam. Fallback não é caixa-preta.
O agente trabalha na sua pasta — com a sua licença
O Modo Code lê os arquivos do projeto, propõe o diff, edita e roda comando. Cada operação passa por aprovação explícita — não existe “ele resolveu sozinho”. E o painel mostra a alteração antes de você aceitar, não depois.
- quatro abas
- Geral, Arquivos, Alterações e Workspace: a conversa, a prévia do arquivo, o diff que ele quer aplicar e o que está do outro lado.
- skills
- Instruções que valem por projeto, importáveis de um repositório git ou de um
SKILL.mdavulso — com o preço à vista antes de você escolher. - documentos
- Markdown do projeto versionado com revisão: o que o agente escreveu ontem continua legível e comparável hoje.
- dois motores
- O gateway do ShvIA ou a assinatura de Claude Code que já está na sua máquina. O painel diz qual está ligado — inclusive qual
anna. - sub-agentes
- Tarefa grande se divide, e o orçamento da árvore é declarado antes: delegação com teto, não com surpresa.
Token que não viaja não é cobrado
Resultado de ferramenta é o maior consumidor de contexto do Modo Code. O RTK comprime esse tráfego antes de ir ao modelo — leitura content-aware de JSON, diffs compactados — e o painel mostra quantos caracteres deixaram de viajar, conta por conta. Não é promessa: é mostrador.
- rtk
- Compressor de resultado de ferramenta no Modo Code: o modelo recebe o que importa, não o despejo bruto.
- diffs
- Alterações de código viajam compactadas — contexto de edição sem pagar o arquivo inteiro de novo.
- cache
- Prompt cache do provedor quando existe — e o que o provedor já cacheia sozinho, o gateway não atrapalha.
- painel
- A economia acumulada aparece na sua conta, medida — no mesmo lugar dos outros mostradores.
Pergunte, vá embora, seja avisado
Nem todo trabalho cabe no tempo de uma tela aberta. Uma rotina é uma cadeia de passos com horário próprio: ela roda sem você, trata o erro passo a passo e entrega o resultado no canal que você escolher — no app, no e-mail, no Telegram ou no WhatsApp.
-
Monte a cadeia
Passos encadeados, cada um com o que fazer se falhar. O envelope de um passo é a entrada do seguinte — e a rotina escolhe a infra e o modelo, como qualquer conversa.
-
Ela roda no horário
Cron declarativo, por usuário. Rotina que se repete tem teto de falhas: quebrou demais, ela para e avisa em vez de insistir em silêncio.
-
Confira a conta
Execução por execução, com tokens, tempo e infra — descontando da mesma cota. Trabalho automático não é trabalho invisível.
- bots
- Um bot é uma conversa com dono: memória própria, que não vaza para as outras, e gasto visível na hora.
- aviso de cota
- A 80% do teto o ShvIA avisa — uma vez por janela, no app e no Telegram. Cota estourada no meio da tarefa não é notícia que se dá depois.
- pergunta demorada
- Resposta que leva minutos sai da conexão aberta e vai para a fila: você fecha a aba e o aviso te encontra.
Aponte o CLI que você já usa
O gateway fala quatro dialetos: o nativo do app, o compatível com
OpenAI, o compatível com a Messages API da Anthropic e a Responses
API. Na prática, a mesma chave liga o Claude Code,
clientes OpenAI-compatíveis e a anna — e cada chamada
passa pela mesma auditoria, cota e recibo do projeto.
-
Gere a chave
No app: Conta → Gerar Chave de API. Ela nasce com prefixo
shvia_usr_, validade de 365 dias — e aparece uma vez só. -
Aponte a base
Duas variáveis de ambiente, nenhum fork, nenhum plugin. O cliente encontra
/v1/messagese/v1/modelssozinho. -
Confira a conta
A chamada do terminal aparece no painel como qualquer conversa: tokens, tempo, infra — e desconta da cota do mesmo projeto.
# dialeto Anthropic (Claude Code, SDK oficial)
$ export ANTHROPIC_BASE_URL=https://ai.shvia.org
$ export ANTHROPIC_API_KEY=shvia_usr_…
$ claude
# dialeto OpenAI (qualquer cliente compatível)
# base_url: https://ai.shvia.org/v1 — GET /v1/models lista os modelos
No app, Conta → Conectar meu CLI gera esse bloco pronto — com o cliente e o modelo escolhidos, e sem nunca embutir a chave numa página. Quem já paga OpenCode ou ChatGPT liga a assinatura no lugar da chave, e o resto do caminho é o mesmo.
Um sistema, sete superfícies
O mesmo gateway atendendo de lugares diferentes. Tokens, tipografia e vocabulário de componentes são os mesmos em todas — um sistema, não dez telas.
- web ShvIA Web — chat, Modo Code, bots, painel de conta e administração. em produção
-
desktop
ShvIA Desktop — janela nativa que se atualiza sozinha, com o
annajá dentro do instalador. O canal publicado hoje traz Linux e macOS; o Windows compila, mas ainda não é publicado. em produção - mobile ShvIA Mobile — iOS e Android, com biometria no destravamento e a sessão que não pede senha de novo. em publicação
-
cli
anna— agente de código no terminal, movido pelo mesmo gateway, com a conta discriminada por papel. em produção - workspace ShvIA Workspace — workspace remoto que hiberna e volta, onde o agente cumpre missões em sandbox isolada pelo kernel. uso interno
- memória ai-memory — memória de longo prazo em markdown versionado, que atravessa agentes e máquinas. código aberto · MIT
- bench SHVIA-BENCH — ambiente isolado para medir modelos em tarefas de engenharia, sem contaminação entre execuções. repositório público
Soberania do contexto
O ShvIA existe para que trabalhar com IA não signifique mandar o contexto da casa para fora sem controle. O sucesso é o usuário nunca precisar perguntar “para onde foi o meu código”.
- on-prem
- Modelos rodando na GPU da própria infraestrutura: o contexto não atravessa a borda da rede.
- byok
- Quando a execução é de nuvem, a chave é sua — o contrato de tratamento de dados é seu, direto com o provedor.
- por projeto
- A política de para onde pode ir cada contexto é decidida por projeto, não por hábito de quem digitou.
- localidade
- Cada provedor declara onde a execução acontece — on-prem, nuvem nos EUA, nuvem na China — e isso fica gravado na requisição, não na memória de quem escolheu.
- máscara
- CPF, CNPJ, e-mail e telefone saem mascarados quando o destino é fora de casa.
- modo estrito
- Com a proteção LGPD ligada, nada do contexto do projeto vai para a nuvem. E a base de conhecimento da casa nunca vai — com ou sem o interruptor.
- rastro
- Requisição, tokens, tempo e infra ficam registrados: dá para auditar depois, não só confiar na hora.
- treino
- O ShvIA não treina modelo com o seu conteúdo. O que sai daqui é uma requisição de inferência.
Perguntas
Consigo entrar direto por aqui?
Qual a diferença entre ai.shvia.org e ia.shvia.org?
ai em
inglês, ia em português — quem digita de cabeça
acerta nos dois.
Preciso de conta? Como consigo uma?
Meus dados treinam algum modelo?
Em que idioma o ShvIA responde?
Posso usar uma assinatura que eu já pago?
Por que o site troca de tema?
Uso o Claude Code — ou outro CLI — com o ShvIA?
/v1 do app fala o dialeto da OpenAI
(/v1/chat/completions, /v1/models) e o da
Anthropic (/v1/messages). Basta apontar a variável de
base do seu cliente para o app e usar a chave gerada no painel — a
seção “Aponte o CLI” mostra as duas
linhas necessárias.
O que a faixa no topo está lendo?
/api/v1/health do app: estado, versão e o tempo que a
sonda levou. Se a leitura falhar, os campos ficam em “—” com o
motivo do lado. Campo em branco é informação; número inventado não.
Entrar no ShvIA
A conversa, o Modo Code e o painel de consumo ficam do outro lado do login.