// roteamento medido
Roteie por atividade e esforço — e veja cada µUSD.
Cada requisição casa uma regra por (atividade, esforço), escolhe o melhor modelo entre os provedores e é medida em µUSD. O playground mostra a rota — e o custo — antes de gastar um token.
Trocar o modelo de uma atividade é editar uma célula da grade: nenhum produto muda de código, nenhum deploy acontece.
A regra é uma cadeia ordenada — falhou o primeiro, o Relay tenta o próximo no mesmo request.
Onze filtros decidem cada candidato, e o trace mostra qual deles barrou quem.
// como o Relay decide
Da requisição ao µUSD medido
A prévia e a chamada real devolvem o mesmo trace — não existe uma versão de brochura e outra de produção.
- Requisiçãocapacidade + esforço
- Regracasa a atividade
- Capacidadesfiltra modelos aptos
- Escolhamelhor custo/qualidade
- Fallbackse falhar, próximo
- MediçãoµUSD, tokens e latência no log
// modalidades
Não é só texto
Cada modalidade é uma atividade roteável, com o mesmo trace, o mesmo orçamento e a mesma medição.
Texto, código e raciocínio
Chat, resumo com contexto longo, código com tool use e modelos de raciocínio — em resposta única ou em streaming pela ponte local.
Embeddings
De 1 a 96 textos por chamada. A capacidade exigida é imposta pela rota, não pela memória de quem escreveu a regra.
Visão
Imagem entra por referência assinada, nunca como bytes no corpo: o Relay busca dentro de uma allowlist e força a capacidade de visão.
Áudio: transcrição e voz
Fala vira texto e texto vira fala. A medição é por segundo de áudio ou por caractere, na mesma conta de µUSD.
Vídeo com avatar
assíncrono · 202 + pollUm render leva minutos: o submit responde na hora e o poll é o motor. Sem webhook obrigatório e com teto de renders simultâneos por Space.
// provedores
Um catálogo fechado, ligado por você
O operador liga o provedor, importa com um clique os modelos que ele anuncia e revisa as capacidades inferidas. Catálogo curado: ninguém pluga um adaptador arbitrário.
A chave de cada provedor vai para o cofre da plataforma — nunca para o banco, nunca para o navegador. Um produto que fala com o Relay não conhece chave de IA nenhuma.
A sua máquina também é um provedor
Um CLI leve pareia a máquina, expõe o Ollama por um túnel de saída e passa a receber jobs do Relay — sem abrir porta e sem endereço público.
Modelo local roda com custo zero, no mesmo catálogo dos pagos.
A resposta pode crescer na tela em streaming, fora do teto de tempo do gateway.
“Dados sensíveis” é política do Space: ligada, derruba todo candidato que não seja comprovadamente local.
// o console
Sete telas para operar tudo isso
O console é a superfície de quem opera: configura, testa e presta contas. Nada aqui exige deploy.
Visão geral
Requisições, custo, latência p50 e fallbacks do dia, com o tráfego por provedor.
Playground
Chamada de mentira, decisão de verdade: a prévia da rota não contata provedor nem gasta token.
Regras de roteamento
A grade atividade × esforço, célula a célula, com a cadeia ordenada de cada regra e os limites globais.
Provedores & modelos
Provedores, chaves, teste de conexão e, sob cada um, seus modelos com capacidades, preço e p50.
Ponte local
Pareamento por código, saúde de cada máquina e o inventário de modelos locais.
Chaves de API
Uma chave por produto ou automação, com escopos, modo test e exibição única.
Uso & custos
O registro paginado de cada requisição, o custo por provedor e a exportação do histórico.
// o que sustenta
A parte que não aparece na tela
Tudo é do Space
Provedores, modelos, regras, chaves e orçamento vivem na partição do Space que os criou. Ler é de qualquer membro; configurar e emitir chave é de admin.
Chaves s7k_* para máquinas
Exibida uma única vez, guardada só como hash e revogada já valendo no request seguinte. Nas rotas de vídeo o escopo é cruzado de verdade.
Só metadados, por padrão
O log guarda modelo, tokens, custo e latência — nunca o prompt nem a resposta. Guardar o corpo é decisão explícita de admin, e o que fica some em 30 dias.
Teto mensal por Space
Um limite em µUSD que entra na decisão como mais um filtro: o local barato continua alcançável quando o modelo caro já não cabe.
Segredo em cofre, não em banco
Cada par (Space, provedor) tem seu próprio segredo. A tela mostra os quatro últimos caracteres, e campo em branco quer dizer “não mexa”.
Quatro portas e um servidor MCP
A mesma regra atende o console, integrações com token de usuário, máquinas com chave e a ponte. Um agente chega pelo MCP e pede capacidade, nunca modelo.
Em construção
Dito aqui antes que você vá procurar na tela.
- Áudio e vídeo ainda não têm playground: hoje essas modalidades se chamam pela API e pelas chaves s7k_*.
- Falta uma página de documentação das APIs dentro do próprio console.
- Inferência local acima de ~18 s em resposta única cai para o próximo modelo da cadeia — o caminho longo é o streaming do playground.