O meta-harness: o que é seu quando todo harness é igual

O harness era o fosso enquanto os harnesses eram diferentes; as listas de recurso convergiram e o que ficou escasso está um andar acima: política, evidência e memória que sobrevivem ao fornecedor da vez.

Abra o painel numa terça de manhã e há cinco agentes trabalhando. Um está refatorando um adaptador de pagamento num sandbox na nuvem. Dois estão revisando pull requests. Um travou há quarenta minutos num teste instável e não avisou. Um terminou, e ninguém sabe dizer se o resultado é confiável ou apenas verde.

A frota chegou antes da capacidade de supervisioná-la. Essa distância é o problema real deste ciclo, e nenhum lançamento de modelo resolve.

Os últimos dois anos ensinaram uma lição que hoje ninguém contesta: o harness importa mais que o modelo. No Terminal-Bench 2.1, o mesmo GPT-5.5 faz 83,4% dentro do Codex CLI da própria OpenAI e 78,2% dentro do harness neutro do benchmark. Cinco pontos de engenharia pura, com os mesmos pesos. A LangChain saiu de 52,8% para 66,5% trocando só o harness — cerca do dobro do que ganhou trocando de modelo. A conclusão era fácil de tirar: alugue o modelo, construa o harness.

Essa conclusão hoje está meio errada.

O fosso subiu um andar

Veja o que um harness de elite entregou em 2026: subagentes com contexto isolado, hooks e políticas sobre o loop, skills carregadas sob demanda, MCP para ferramentas, sandbox no nível do kernel, checkpoints, agentes em background. Agora veja o segundo. E o terceiro. As listas são idênticas.

A convergência é boa notícia para quem compra e péssima para quem achava que o próprio harness era diferencial. Quando todo fornecedor entrega as mesmas sete capacidades, essas capacidades deixam de ser ativo e viram o mínimo para entrar no jogo. O MCP foi para a Linux Foundation em dezembro de 2025, com mais de 17.000 servidores públicos. Skills viraram um formato que cerca de quarenta ferramentas conseguem ler. As peças que todo mundo dizia ser o fosso são hoje as peças que qualquer um compra numa tarde.

O mercado percebeu antes da maioria dos times de engenharia. O GitHub vende o Agent HQ como centro de controle de uma frota de agentes de todos os laboratórios, não só dos seus. O Windsurf voltou como um cockpit onde Codex, Claude e Devin são trocáveis no meio da sessão, por um protocolo aberto. Esses produtos não são harnesses. São a camada que roda harnesses — o meta-harness — e o discurso de venda inteiro é que o que está embaixo é intercambiável.

É a mesma aposta que estava certa sobre modelos, aplicada um andar acima. Se a sua operação mora dentro do harness de um fornecedor, você herdou o roadmap dele, o modelo de permissão dele e a ideia dele do que significa “pronto”.

O que é realmente seu

Três coisas não vêm na caixa de ninguém, e são o ativo inteiro.

Política. Quais repositórios um agente pode tocar, quais comandos rodam sem humano, o que precisa parar e esperar. Todo harness tem um recurso de permissões; nenhum deles sabe que a sua integração fiscal não pode ser reprocessada depois das 18h, nem que mudança de schema no catálogo exige duas aprovações. Essas regras são suas, escritas, e precisam sobreviver a uma troca de ferramenta.

Evidência. Traces, custo por tarefa, taxa de sucesso e uma suíte de eval que reflete o seu domínio, não o leaderboard de alguém. É a única coisa que até os céticos de construir em vez de comprar mandam construir. Sem ela você não gerencia uma frota, você assiste a uma e torce.

Memória. O conhecimento operacional que se acumula: skills de domínio empacotadas para o agente carregar, e um arquivo de projeto em que cada regra remete a uma falha real que alguém viu acontecer. Não é guia de estilo. É registro de cicatriz.

Existe uma boa medida de quanto essa camada vale. O GitHub Copilot passou de 19% para 72% de acerto numa suíte-alvo cortando as ferramentas expostas de mais de quarenta para treze. Ninguém trocou de modelo. Alguém decidiu o que o agente tinha permissão de enxergar. Essa decisão não é um recurso que se compra; é disciplina de contexto, e é exatamente o tipo de coisa que mora no meta-harness ou não mora em lugar nenhum.

O teste é se você consegue trocar numa terça

Esta é a versão prática, e leva cerca de um minuto para rodar contra a sua própria montagem.

Pegue o harness que seu time usa hoje. Agora imagine que um concorrente publica no mês que vem um benchmark dez pontos melhor, o que na cadência atual é quase certo. Você consegue mudar? Especificamente: seus gates e suas permissões viajam junto, ou estão clicados no console de um fornecedor? Seus evals rodam contra qualquer agente, ou só dentro daquele produto? O conhecimento do seu domínio existe como skills portáteis e arquivos simples, ou como pedaços de prompt espalhados pela interface de alguém?

Se a resposta for não, você não tem um meta-harness. Você tem uma dependência com uma boa demo.

Os times que operam bem são chatos nisso. Compram o loop, porque o loop é commodity e já apanhou bastante. Compram o sandbox. Constroem política, evals e memória, e guardam tudo isso no repositório deles, em formatos que sobrevivem à ferramenta. Quando o líder muda — e o líder muda mais ou menos a cada trimestre — a migração é exercício de configuração, não reescrita.

O Gartner projeta que mais de 40% dos projetos de agentes serão cancelados até 2027. Pouquíssimos vão morrer porque o modelo não era inteligente o bastante. Vão morrer porque ninguém conseguiu responder, seis meses depois, se a coisa estava funcionando.

Alugue o modelo. Troque o harness. Guarde a evidência.