S7 AI Relay
Capacidade de plataforma · roteamento de IA

Um endpoint. Todos os modelos. Sob controle.

Um roteador para todas as IAs da Seventy Sete — peça a capacidade, o Relay escolhe o modelo, mede o custo em µUSD e mostra o porquê.

atividades roteáveis

código, chat, resumo, visão, raciocínio, embeddings, transcrição, voz e vídeo

9

níveis de esforço

do baixo ao superior — chave de busca, nunca palpite

5

endpoint para todos os provedores

nenhum produto guarda chave de IA

1

a unidade de cada medição

micro-dólar inteiro — dinheiro nunca é ponto flutuante

µUSD

// roteamento medido

Roteie por atividade e esforço — e veja cada µUSD.

Cada requisição casa uma regra por (atividade, esforço), escolhe o melhor modelo entre os provedores e é medida em µUSD. O playground mostra a rota — e o custo — antes de gastar um token.

Trocar o modelo de uma atividade é editar uma célula da grade: nenhum produto muda de código, nenhum deploy acontece.

A regra é uma cadeia ordenada — falhou o primeiro, o Relay tenta o próximo no mesmo request.

Onze filtros decidem cada candidato, e o trace mostra qual deles barrou quem.

// como o Relay decide

Da requisição ao µUSD medido

A prévia e a chamada real devolvem o mesmo trace — não existe uma versão de brochura e outra de produção.

  1. Requisiçãocapacidade + esforço
  2. Regracasa a atividade
  3. Capacidadesfiltra modelos aptos
  4. Escolhamelhor custo/qualidade
  5. Fallbackse falhar, próximo
  6. MediçãoµUSD, tokens e latência no log

// modalidades

Não é só texto

Cada modalidade é uma atividade roteável, com o mesmo trace, o mesmo orçamento e a mesma medição.

Texto, código e raciocínio

Chat, resumo com contexto longo, código com tool use e modelos de raciocínio — em resposta única ou em streaming pela ponte local.

Embeddings

De 1 a 96 textos por chamada. A capacidade exigida é imposta pela rota, não pela memória de quem escreveu a regra.

Visão

Imagem entra por referência assinada, nunca como bytes no corpo: o Relay busca dentro de uma allowlist e força a capacidade de visão.

Áudio: transcrição e voz

Fala vira texto e texto vira fala. A medição é por segundo de áudio ou por caractere, na mesma conta de µUSD.

Vídeo com avatar

assíncrono · 202 + poll

Um render leva minutos: o submit responde na hora e o poll é o motor. Sem webhook obrigatório e com teto de renders simultâneos por Space.

// provedores

Um catálogo fechado, ligado por você

O operador liga o provedor, importa com um clique os modelos que ele anuncia e revisa as capacidades inferidas. Catálogo curado: ninguém pluga um adaptador arbitrário.

Anthropic
OpenAI
Google Gemini
OpenRouter
Groq
Qwen
Cloudflare
MiniMax
ElevenLabs
HeyGen
Ollama
// sem adaptador aindaMistral AI · em brevexAI Grok · em breve

A chave de cada provedor vai para o cofre da plataforma — nunca para o banco, nunca para o navegador. Um produto que fala com o Relay não conhece chave de IA nenhuma.

Ponte local

A sua máquina também é um provedor

Um CLI leve pareia a máquina, expõe o Ollama por um túnel de saída e passa a receber jobs do Relay — sem abrir porta e sem endereço público.

Modelo local roda com custo zero, no mesmo catálogo dos pagos.

A resposta pode crescer na tela em streaming, fora do teto de tempo do gateway.

“Dados sensíveis” é política do Space: ligada, derruba todo candidato que não seja comprovadamente local.

// o console

Sete telas para operar tudo isso

O console é a superfície de quem opera: configura, testa e presta contas. Nada aqui exige deploy.

Visão geral

Requisições, custo, latência p50 e fallbacks do dia, com o tráfego por provedor.

Playground

Chamada de mentira, decisão de verdade: a prévia da rota não contata provedor nem gasta token.

Regras de roteamento

A grade atividade × esforço, célula a célula, com a cadeia ordenada de cada regra e os limites globais.

Provedores & modelos

Provedores, chaves, teste de conexão e, sob cada um, seus modelos com capacidades, preço e p50.

Ponte local

Pareamento por código, saúde de cada máquina e o inventário de modelos locais.

Chaves de API

Uma chave por produto ou automação, com escopos, modo test e exibição única.

Uso & custos

O registro paginado de cada requisição, o custo por provedor e a exportação do histórico.

// o que sustenta

A parte que não aparece na tela

Tudo é do Space

Provedores, modelos, regras, chaves e orçamento vivem na partição do Space que os criou. Ler é de qualquer membro; configurar e emitir chave é de admin.

Chaves s7k_* para máquinas

Exibida uma única vez, guardada só como hash e revogada já valendo no request seguinte. Nas rotas de vídeo o escopo é cruzado de verdade.

Só metadados, por padrão

O log guarda modelo, tokens, custo e latência — nunca o prompt nem a resposta. Guardar o corpo é decisão explícita de admin, e o que fica some em 30 dias.

Teto mensal por Space

Um limite em µUSD que entra na decisão como mais um filtro: o local barato continua alcançável quando o modelo caro já não cabe.

Segredo em cofre, não em banco

Cada par (Space, provedor) tem seu próprio segredo. A tela mostra os quatro últimos caracteres, e campo em branco quer dizer “não mexa”.

Quatro portas e um servidor MCP

A mesma regra atende o console, integrações com token de usuário, máquinas com chave e a ponte. Um agente chega pelo MCP e pede capacidade, nunca modelo.

Em construção

Dito aqui antes que você vá procurar na tela.

  • Áudio e vídeo ainda não têm playground: hoje essas modalidades se chamam pela API e pelas chaves s7k_*.
  • Falta uma página de documentação das APIs dentro do próprio console.
  • Inferência local acima de ~18 s em resposta única cai para o próximo modelo da cadeia — o caminho longo é o streaming do playground.

Ligue um provedor e veja a primeira rota

Um Space novo nasce vazio de propósito — nada de modelo de mentira que parece configurado. Você liga o provedor, importa os modelos, aponta uma célula da grade, e o playground mostra a decisão antes de gastar um token.