Engine nativaMetis 2.0

Um modelo. Decisões calibradas. Custo por tarefa aceita.

Metis 2.0 é o que roda quando você não traz chave. Um modelo rápido em todo turno, sem escalação para um modelo caro. O que mudou é a política em volta dele: decisões tipadas e calibradas, cache disciplinado, verificação só onde dá para verificar. Você não muda uma linha; e pode trocar por BYOK sem perder a memória.

modelo em todo turno
1
sem escalação para modelo caro; falha propaga, não sobe de preço
índice de inteligência
52
Artificial Analysis v4.1, thinking no chat (29 sem)
mais barato no cache-hit
50×
$0,006 contra $0,30 por 1M tokens de entrada
dos turnos com decisão gravada
100%
gate tipado em shadow, par decisão → resultado por tenant
01O que mudou

Da 1.2 para a 2.0: menos modelo, mais política.

A 1.2 tinha um modelo rápido respondendo e um caro fechando gate, plano e retry. A 2.0 tira o caro do caminho e coloca decisão no lugar. O nome Metis continua interno: é a engine, não o produto.

CamadaMetis 1.2Metis 2.0
ModeloRápido responde; um modelo caro fechava gate, plano e retrySó o rápido, em todo turno. Hosts oficiais + standby do mesmo modelo
EscalaçãoGate rejeita → roda de novo no caroUm reparo no próprio modelo, com a crítica; se falha, a primeira resposta fica
PlanoJSON em texto livre, parse podia falharDecisão estruturada: perguntas paralelas, zero erro de tipo
GateVerificador em textoVerificador curto + confiança calibrada, só quando o turno tem sinal
ThinkingSempre ligado no chatAdaptativo: small talk não pensa; crise e PII travam o protocolo
CacheAutomático, sem medirPrefixo estável por desenho; memória e RAG no último turno; meter cobra o hit
ContextoHistórico inteiroElisão do meio + resumo assíncrono com cursor; sem novidade, zero tokens
JobsQualquer horárioMemória, fatos e insights só fora do pico (metade do preço)
QualidadeMedida informalmenteEval pt-BR na CI com piso; Brier/ECE sobre produção
02Decisões

A engine decide contexto. Não só armazena.

Todo mundo guarda memória. A Metis 2.0 decide o que entra, quando pensar e quando verificar, com confiança calibrada por resultado real. O código em volta segura a política; o modelo só julga.

  • Gate tipado

    Três perguntas binárias com probabilidade, em todo turno. A resposta só passa se a confiança segura; abaixo disso, um reparo.

  • Thinking por sinal

    Pensa quando o turno tem conhecimento ou parece recusa. Small talk responde direto. Medido: +0,8 s e +114 tokens por turno quando liga.

  • Verificação só onde dá

    Test-time compute com verificador no code mode e em turnos com knowledge. Chat sem sinal é single shot.

  • Segurança fora do modelo

    Filtro de conteúdo, PII e crise são regras antes do modelo. Nenhuma cabeça de decisão substitui o regex; só soma.

  • Segunda cabeça em shadow

    Um segundo decisor tipado roda ao lado, sem alterar resposta, gravando concordância. Ativa por número, não por opinião.

  • Decisão → resultado

    Cada decisão grava id, ação, aceite e custo por tenant e organização. É o dataset que calibra a próxima versão.

03Preço

Tabela oficial. O cache decide a conta.

Preço por 1 milhão de tokens, tabela de 10 de setembro de 2026. Fora do pico custa metade, e o dia comercial no Brasil inteiro é fora do pico. O meter cobra o token servido do cache pelo preço do cache, não como entrada nova.

Por 1M tokensPicoFora do pico
Entrada nova$0,30$0,15
Entrada servida do cache$0,006$0,003
Saída$1,20$0,60

Um prompt que repete o prefixo entre turnos paga 2% pelo que repete. Por isso a alavanca dominante é o hit rate de cache, não a troca de modelo: no mesmo volume, 30% de hit custa 3× o que custa 85%.

Escada de custo · 8B tokens/mêssimulação · 15/09
Custo mensal por alavanca, acumulado (USD)USD/mês
  1. Metis 1.2 (tabela antiga, 10% no modelo caro)
    $2.705
  2. Metis 2.0 · um modelo, tabela oficial, off-peak
    $821
  3. + thinking adaptativo
    $849
  4. + SLO de prefix-cache (50% → 85% hit)
    $458
  5. + compressão de contexto
    $406
  6. + decision layer
    $325
  7. + caches semânticos
    $276
  8. + batch fora do pico
    $236
Ver tabela
CenárioUSD/mês
Metis 1.2 (tabela antiga, 10% no modelo caro)$2.705
Metis 2.0 · um modelo, tabela oficial, off-peak$821
+ thinking adaptativo$849
+ SLO de prefix-cache (50% → 85% hit)$458
+ compressão de contexto$406
+ decision layer$325
+ caches semânticos$276
+ batch fora do pico$236

Só a segunda barra está em produção: um modelo, tabela oficial, fora do pico (−70%). Cada linha seguinte é uma alavanca que só entra depois de passar no eval pareado com o custo no mesmo relatório. No volume de um agente de código pesado (16,9 mil requisições, 3,65 bilhões de tokens), a conta cai de $119 para $26 por mês.

04Qualidade

Mesmo índice. Sem rede do modelo caro.

O risco de tirar o modelo caro é o texto livre difícil. A resposta não é outro modelo: é reparo com crítica, thinking por sinal, abstenção por confiança e eval pt-BR bloqueando a CI.

DimensãoMetis 1.2Metis 2.0Evidência
Inteligência geral52 com thinking52 mantidomedição própria
Texto livre difícilrede de segurança do modelo caroreparo + thinking + abstençãoúnico risco real, coberto pelo eval
Decisões estruturadastexto + parsetipo-segurozero erro de tipo
Calibraçãoinexistenteconfiança roteia reparo/revisãoBrier/ECE em produção
Latência p95segunda passada no caminhosem segunda passadaganho direto
Crise e PIItravado no rápidoigualpor design

Índice: Artificial Analysis Intelligence Index v4.1, nove avaliações incluindo agentes em terminal e atendimento. Teste próprio com prompts de CRM em português: thinking ligado custou +0,8 s e +114 tokens por turno, resposta do mesmo tamanho. Em loops de agente o thinking desliga, porque em 24 passos o raciocínio custa mais do que rende.

05Ainda não publicado

Os números que faltam. E por quê.

A promessa tem o tamanho da prova. O que está abaixo entra nesta página quando o dado segurar; até lá, não vai no pitch.

  • Hit rate real de cache

    Primeira leitura em turnos ≥2: ~50%. Meta 80%. Sem 80%, não vendemos economia.

  • Custo por tarefa aceita do cliente zero

    Em medição no tráfego real desde 17/09. Entra aqui quando fechar com a fatura do mês.

  • Ganho em dois modelos

    A promessa "melhora qualquer LLM" só publica com eval no nativo e em pelo menos um BYOK.

O que a Maytiq soma por cima da engine, em qualquer modelo: memória em quatro níveis, isolamento por organização testado no CI, conhecimento com aterramento estrito e o custo por tarefa aceita visível no console.

Seja um design partner.

5 vagas de piloto com preço travado. Uma conversa de 20 minutos para ver se a Maytiq cabe no seu produto — sem compromisso, sem fila genérica.

Sem spam. Um e-mail quando chegar a sua vez.