S7 AI Relay
Capacidad de plataforma · enrutamiento de IA

Un endpoint. Todos los modelos. Bajo control.

Un enrutador para todas las IAs de Seventy Sete — pide la capacidad, el Relay elige el modelo, mide el coste en µUSD y muestra por qué.

actividades enrutables

código, chat, resumen, visión, razonamiento, embeddings, transcripción, voz y vídeo

9

niveles de esfuerzo

de bajo a superior — clave de búsqueda, nunca conjetura

5

endpoint para todos los proveedores

ningún producto guarda una clave de IA

1

la unidad de cada medición

micro-dólares enteros — el dinero nunca es coma flotante

µUSD

// enrutamiento medido

Enruta por actividad y esfuerzo — y mira cada µUSD.

Cada petición casa una regla por (actividad, esfuerzo), elige el mejor modelo entre los proveedores y se mide en µUSD. El playground muestra la ruta — y el coste — antes de gastar un token.

Cambiar el modelo de una actividad es editar una celda de la rejilla: ningún producto cambia de código, ningún despliegue ocurre.

La regla es una cadena ordenada — si falla el primero, el Relay prueba el siguiente en la misma petición.

Once filtros juzgan a cada candidato, y la traza dice cuál de ellos frenó a quién.

// cómo decide el Relay

De la petición al µUSD medido

La vista previa y la llamada real devuelven la misma traza — no hay una versión de folleto y otra de producción.

  1. Peticióncapacidad + esfuerzo
  2. Reglacasa la actividad
  3. Capacidadesfiltra modelos aptos
  4. Elecciónmejor coste/calidad
  5. Fallbacksi falla, el siguiente
  6. MediciónµUSD, tokens y latencia en el registro

// modalidades

No es solo texto

Cada modalidad es una actividad enrutable, con la misma traza, el mismo presupuesto y la misma medición.

Texto, código y razonamiento

Chat, resumen con contexto largo, código con tool use y modelos de razonamiento — en una sola respuesta o en streaming por el puente local.

Embeddings

De 1 a 96 textos por llamada. La capacidad exigida la impone la ruta, no la memoria de quien escribió la regla.

Visión

La imagen entra como referencia firmada, nunca como bytes en el cuerpo: el Relay la descarga dentro de una allowlist y fuerza la capacidad de visión.

Audio: transcripción y voz

El habla se vuelve texto y el texto se vuelve habla. La medición cuenta segundos de audio o caracteres, en la misma aritmética de µUSD.

Vídeo con avatar

asíncrono · 202 + poll

Un render tarda minutos: el envío responde al instante y el poll es el motor. Sin webhook obligatorio y con tope de renders simultáneos por Space.

// proveedores

Un catálogo cerrado, encendido por ti

El operador enciende el proveedor, importa con un clic los modelos que anuncia y revisa las capacidades inferidas. Catálogo curado: nadie enchufa un adaptador arbitrario.

Anthropic
OpenAI
Google Gemini
OpenRouter
Groq
Qwen
Cloudflare
MiniMax
ElevenLabs
HeyGen
Ollama
// aún sin adaptadorMistral AI · próximamentexAI Grok · próximamente

La clave de cada proveedor va a la caja fuerte de la plataforma — nunca a la base de datos, nunca al navegador. Un producto que habla con el Relay no conoce ninguna clave de IA.

Puente local

Tu propia máquina también es un proveedor

Un CLI ligero empareja la máquina, expone Ollama por un túnel de salida y empieza a recibir trabajos del Relay — sin abrir puertos y sin dirección pública.

Un modelo local corre con coste cero, en el mismo catálogo que los de pago.

La respuesta puede crecer en pantalla en streaming, fuera del tope de tiempo de la pasarela.

«Datos sensibles» es política del Space: encendida, descarta a todo candidato que no sea comprobadamente local.

// la consola

Siete pantallas para operarlo todo

La consola es la superficie de quien opera: configura, prueba y rinde cuentas. Nada de aquí exige un despliegue.

Visión general

Peticiones, coste, latencia p50 y fallbacks del día, con el tráfico por proveedor.

Playground

Llamada de mentira, decisión de verdad: la vista previa de la ruta no contacta a ningún proveedor ni gasta un token.

Reglas de enrutamiento

La rejilla actividad × esfuerzo, celda a celda, con la cadena ordenada de cada regla y los límites globales.

Proveedores y modelos

Proveedores, claves, prueba de conexión y, bajo cada uno, sus modelos con capacidades, precio y p50.

Puente local

Emparejamiento por código, salud de cada máquina e inventario de modelos locales.

Claves de API

Una clave por producto o automatización, con ámbitos, modo test y una única exhibición.

Uso y costes

El registro paginado de cada petición, el coste por proveedor y la exportación del histórico.

// lo que lo sostiene

La parte que nunca aparece en pantalla

Todo es del Space

Proveedores, modelos, reglas, claves y presupuesto viven en la partición del Space que los creó. Leer puede cualquier miembro; configurar y emitir claves es de admin.

Claves s7k_* para máquinas

Se muestra una sola vez, se guarda solo como hash y se revoca con efecto en la petición siguiente. En las rutas de vídeo el ámbito se cruza de verdad.

Solo metadatos, por defecto

El registro guarda modelo, tokens, coste y latencia — nunca el prompt ni la respuesta. Guardar el cuerpo es decisión explícita de admin, y lo guardado caduca en 30 días.

Tope mensual por Space

Un límite en µUSD que entra en la decisión como un filtro más: el local barato sigue alcanzable cuando el modelo caro ya no cabe.

Secreto en caja fuerte, no en tabla

Cada par (Space, proveedor) tiene su propio secreto. La pantalla muestra los cuatro últimos caracteres, y un campo en blanco significa «no lo toques».

Cuatro puertas y un servidor MCP

La misma regla atiende a la consola, a integraciones con token de usuario, a máquinas con clave y al puente. Un agente llega por MCP y pide capacidad, nunca modelo.

En construcción

Dicho aquí antes de que vayas a buscarlo en pantalla.

  • Audio y vídeo aún no tienen playground: hoy esas modalidades se llaman por la API y por las claves s7k_*.
  • Falta una página de documentación de las APIs dentro de la consola.
  • La inferencia local por encima de ~18 s en respuesta única cae al siguiente modelo de la cadena — el camino largo es el streaming del playground.

Enciende un proveedor y mira la primera ruta

Un Space nuevo nace vacío a propósito — nada de modelos de mentira que parecen configurados. Enciendes el proveedor, importas los modelos, apuntas una celda de la rejilla, y el playground muestra la decisión antes de gastar un token.