Um modelo. Decisões calibradas. Custo por tarefa aceita.
Metis 2.0 é o que roda quando você não traz chave. Um modelo rápido em todo turno, sem escalação para um modelo caro. O que mudou é a política em volta dele: decisões tipadas e calibradas, cache disciplinado, verificação só onde dá para verificar. Você não muda uma linha; e pode trocar por BYOK sem perder a memória.
- modelo em todo turno
- 1
- sem escalação para modelo caro; falha propaga, não sobe de preço
- índice de inteligência
- 52
- Artificial Analysis v4.1, thinking no chat (29 sem)
- mais barato no cache-hit
- 50×
- $0,006 contra $0,30 por 1M tokens de entrada
- dos turnos com decisão gravada
- 100%
- gate tipado em shadow, par decisão → resultado por tenant
Da 1.2 para a 2.0: menos modelo, mais política.
A 1.2 tinha um modelo rápido respondendo e um caro fechando gate, plano e retry. A 2.0 tira o caro do caminho e coloca decisão no lugar. O nome Metis continua interno: é a engine, não o produto.
| Camada | Metis 1.2 | Metis 2.0 |
|---|---|---|
| Modelo | Rápido responde; um modelo caro fechava gate, plano e retry | Só o rápido, em todo turno. Hosts oficiais + standby do mesmo modelo |
| Escalação | Gate rejeita → roda de novo no caro | Um reparo no próprio modelo, com a crítica; se falha, a primeira resposta fica |
| Plano | JSON em texto livre, parse podia falhar | Decisão estruturada: perguntas paralelas, zero erro de tipo |
| Gate | Verificador em texto | Verificador curto + confiança calibrada, só quando o turno tem sinal |
| Thinking | Sempre ligado no chat | Adaptativo: small talk não pensa; crise e PII travam o protocolo |
| Cache | Automático, sem medir | Prefixo estável por desenho; memória e RAG no último turno; meter cobra o hit |
| Contexto | Histórico inteiro | Elisão do meio + resumo assíncrono com cursor; sem novidade, zero tokens |
| Jobs | Qualquer horário | Memória, fatos e insights só fora do pico (metade do preço) |
| Qualidade | Medida informalmente | Eval pt-BR na CI com piso; Brier/ECE sobre produção |
A engine decide contexto. Não só armazena.
Todo mundo guarda memória. A Metis 2.0 decide o que entra, quando pensar e quando verificar, com confiança calibrada por resultado real. O código em volta segura a política; o modelo só julga.
Gate tipado
Três perguntas binárias com probabilidade, em todo turno. A resposta só passa se a confiança segura; abaixo disso, um reparo.
Thinking por sinal
Pensa quando o turno tem conhecimento ou parece recusa. Small talk responde direto. Medido: +0,8 s e +114 tokens por turno quando liga.
Verificação só onde dá
Test-time compute com verificador no code mode e em turnos com knowledge. Chat sem sinal é single shot.
Segurança fora do modelo
Filtro de conteúdo, PII e crise são regras antes do modelo. Nenhuma cabeça de decisão substitui o regex; só soma.
Segunda cabeça em shadow
Um segundo decisor tipado roda ao lado, sem alterar resposta, gravando concordância. Ativa por número, não por opinião.
Decisão → resultado
Cada decisão grava id, ação, aceite e custo por tenant e organização. É o dataset que calibra a próxima versão.
Tabela oficial. O cache decide a conta.
Preço por 1 milhão de tokens, tabela de 10 de setembro de 2026. Fora do pico custa metade, e o dia comercial no Brasil inteiro é fora do pico. O meter cobra o token servido do cache pelo preço do cache, não como entrada nova.
| Por 1M tokens | Pico | Fora do pico |
|---|---|---|
| Entrada nova | $0,30 | $0,15 |
| Entrada servida do cache | $0,006 | $0,003 |
| Saída | $1,20 | $0,60 |
Um prompt que repete o prefixo entre turnos paga 2% pelo que repete. Por isso a alavanca dominante é o hit rate de cache, não a troca de modelo: no mesmo volume, 30% de hit custa 3× o que custa 85%.
- Metis 1.2 (tabela antiga, 10% no modelo caro)$2.705
- Metis 2.0 · um modelo, tabela oficial, off-peak$821
- + thinking adaptativo$849
- + SLO de prefix-cache (50% → 85% hit)$458
- + compressão de contexto$406
- + decision layer$325
- + caches semânticos$276
- + batch fora do pico$236
Ver tabela
| Cenário | USD/mês |
|---|---|
| Metis 1.2 (tabela antiga, 10% no modelo caro) | $2.705 |
| Metis 2.0 · um modelo, tabela oficial, off-peak | $821 |
| + thinking adaptativo | $849 |
| + SLO de prefix-cache (50% → 85% hit) | $458 |
| + compressão de contexto | $406 |
| + decision layer | $325 |
| + caches semânticos | $276 |
| + batch fora do pico | $236 |
Só a segunda barra está em produção: um modelo, tabela oficial, fora do pico (−70%). Cada linha seguinte é uma alavanca que só entra depois de passar no eval pareado com o custo no mesmo relatório. No volume de um agente de código pesado (16,9 mil requisições, 3,65 bilhões de tokens), a conta cai de $119 para $26 por mês.
Mesmo índice. Sem rede do modelo caro.
O risco de tirar o modelo caro é o texto livre difícil. A resposta não é outro modelo: é reparo com crítica, thinking por sinal, abstenção por confiança e eval pt-BR bloqueando a CI.
| Dimensão | Metis 1.2 | Metis 2.0 | Evidência |
|---|---|---|---|
| Inteligência geral | 52 com thinking | 52 mantido | medição própria |
| Texto livre difícil | rede de segurança do modelo caro | reparo + thinking + abstenção | único risco real, coberto pelo eval |
| Decisões estruturadas | texto + parse | tipo-seguro | zero erro de tipo |
| Calibração | inexistente | confiança roteia reparo/revisão | Brier/ECE em produção |
| Latência p95 | segunda passada no caminho | sem segunda passada | ganho direto |
| Crise e PII | travado no rápido | igual | por design |
Índice: Artificial Analysis Intelligence Index v4.1, nove avaliações incluindo agentes em terminal e atendimento. Teste próprio com prompts de CRM em português: thinking ligado custou +0,8 s e +114 tokens por turno, resposta do mesmo tamanho. Em loops de agente o thinking desliga, porque em 24 passos o raciocínio custa mais do que rende.
Os números que faltam. E por quê.
A promessa tem o tamanho da prova. O que está abaixo entra nesta página quando o dado segurar; até lá, não vai no pitch.
Hit rate real de cache
Primeira leitura em turnos ≥2: ~50%. Meta 80%. Sem 80%, não vendemos economia.
Custo por tarefa aceita do cliente zero
Em medição no tráfego real desde 17/09. Entra aqui quando fechar com a fatura do mês.
Ganho em dois modelos
A promessa "melhora qualquer LLM" só publica com eval no nativo e em pelo menos um BYOK.
O que a Maytiq soma por cima da engine, em qualquer modelo: memória em quatro níveis, isolamento por organização testado no CI, conhecimento com aterramento estrito e o custo por tarefa aceita visível no console.


Seja um design partner.
5 vagas de piloto com preço travado. Uma conversa de 20 minutos para ver se a Maytiq cabe no seu produto — sem compromisso, sem fila genérica.