Durante cerca de um ano, a minha lógica para escolher modelos foi preguiçosa e funcionou: se a tarefa era importante, ia buscar o Opus. Se não era, ia buscar o Sonnet e aceitava que o resultado seria um bocadinho pior. Dois níveis, dois preços, um atalho mental limpo.
O Claude Sonnet 5 partiu esse atalho a 30 de junho de 2026, e eu ainda me estou a adaptar.
Aqui vai a versão curta, porque pesquisaste Claude Sonnet 5 vs Opus 4.8 e mereces a resposta antes de rolar a página: o Sonnet 5 fica a poucos pontos do Opus 4.8 na maioria dos benchmarks, chega a vencê-lo em trabalho de conhecimento e custa 40% do preço por token de entrada. Mas há uma configuração escondida na API — o nível de esforço — que pode silenciosamente virar o Sonnet 5 de "pechincha incrível" para "mais caro do que o Opus para o mesmo resultado". A decisão toda vive nesse detalhe, e quase ninguém está a falar disso.
Então vamos falar. Não o comunicado de imprensa. A matemática real, a armadilha e a regra que agora uso para escolher entre eles tarefa a tarefa.
Onde encaixa o Sonnet 5 na linha Claude
O Sonnet 5 é o novo modelo de gama média da família Claude — a posição entre os modelos de entrada e os pesos-pesados das linhas Opus e Fable/Mythos. No papel, é "apenas" uma atualização do Sonnet. Na prática, o salto face ao Sonnet 4.6 é o maior ganho de uma única geração que já vi neste escalão, e a distância para o Opus 4.8 encolheu para algo genuinamente incómodo para os próprios níveis de preço da Anthropic.
Ficou disponível no dia do lançamento como modelo por defeito para os planos Free e Pro e está disponível para Max, Team, Enterprise e via API. Se usaste o Claude na web desde o final de junho e não mexeste em nada, provavelmente já andas a falar com o Sonnet 5 sem saber.
O enquadramento a que todos recorreram — TechCrunch, VentureBeat, The New Stack — foi alguma versão de "uma forma mais barata de correr agentes". É verdade, mas subestima a mudança estrutural. Pela primeira vez, o Sonnet e o Opus assentam numa única curva de custo-desempenho em vez de dois níveis separados. A antiga divisão "modelo bom / modelo excelente" é agora "mesma família de modelos, escolhe o teu ponto na curva". Isso muda a forma de arquitetar qualquer coisa que faça mais do que um punhado de chamadas ao modelo.
Antes de chegarmos à curva, olha para onde os números realmente caem. É a parte que o marketing dourou.
O quadro dos benchmarks, lido com honestidade
Aqui está a comparação da própria Anthropic, e quero lê-la como a leria antes de apostar um projeto nela — coluna a coluna, não como um trailer promocional.
Codificação agêntica, SWE-bench Pro: o Sonnet 5 chega aos 63,2%, subindo dos 58,1% do Sonnet 4.6, com o Opus 4.8 ainda no topo com 69,2%. Esta é a maior diferença clara em todo o painel — seis pontos. Se a tua carga de trabalho é codificação difícil, multi-ficheiro e autónoma, é este o número que te deve fazer parar. O Opus é significativamente melhor aqui, e vamos voltar ao porquê de esses seis pontos importarem mais do que parece.
Codificação agêntica, Terminal-Bench 2.1: o Sonnet 5 salta para 80,4% face aos 67,0% do 4.6 — um salto de treze pontos numa geração. Onde o Opus 4.8 aterra neste harness específico é genuinamente disputado: alguns relatórios colocam-no dois pontos à frente do Sonnet 5, outros colocam-no vários pontos atrás, por isso não vou tirar conclusões do Terminal-Bench para qualquer lado. O que não está em disputa é que o Sonnet 5 deixou o seu antecessor a comer pó aqui.
Raciocínio multidisciplinar, Humanity's Last Exam: sem ferramentas, 43,2% vs 49,8% do Opus. Com ferramentas, 57,4% vs 57,9% do Opus — basicamente um empate. O resultado com ferramentas é o sinal revelador: dá ao Sonnet 5 a capacidade de pesquisar e chamar funções, e o seu défice de raciocínio face ao Opus quase se evapora. A maior parte das cargas reais de agentes tem ferramentas. Guarda isso no bolso.
Uso do computador, OSWorld-Verified: 81,2% vs 83,4% do Opus. Dois pontos. Para conduzir um browser ou um desktop, é ruído na maioria das tarefas.
Trabalho de conhecimento, GDPval-AA v2: o Sonnet 5 marca 1618. O Opus 4.8 marca 1615. O modelo de gama média venceu. Não por um triunfo esmagador, mas venceu — no benchmark mais próximo de "fazer trabalho profissional útil em várias disciplinas".
Recua um passo e a forma é inconfundível: queda mínima face ao Opus quase em todo o lado, uma vitória clara em trabalho de conhecimento e exatamente uma categoria — codificação agêntica difícil — onde o Opus mantém alguma luz do dia real. Isso é um fosso notavelmente estreito para um modelo que custa mais do dobro.
O que nos leva ao dinheiro, porque os benchmarks são só metade da decisão.
A matemática dos preços que mexe mesmo o ponteiro
Os benchmarks dizem-te o que é possível. Os preços dizem-te o que é acessível em escala. E é aqui que o Sonnet 5 deixa de ser interessante e começa a ser disruptivo.
Por milhão de tokens, aqui está a formação à data do lançamento:
- Fable 5 / Mythos 5: 10 $ de entrada / 50 $ de saída — o teto premium
- Opus 4.8: 5 $ de entrada / 25 $ de saída
- Sonnet 5: 2 $ de entrada / 10 $ de saída
Lê a linha do Sonnet 5 contra o Opus. A entrada custa 40% do preço do Opus. A saída é menos de metade. Isso não é um desconto — é uma categoria de orçamento diferente.
Um detalhe que a cobertura do dia do lançamento assinalou e que precisas de planear: esses 2 $/10 $ são preços introdutórios, em vigor até 31 de agosto de 2026. Depois disso, sobem para 3 $/15 $. A Anthropic definiu o preço introdutório para que a transição para os utilizadores existentes do Sonnet fosse aproximadamente neutra em custo, mas se estás a montar uma previsão com base nestes números, modela a taxa pós-agosto. 3 $/15 $ continua bem abaixo dos 5 $/25 $ do Opus — só não é a liquidação que são os primeiros dois meses.
Agora vamos ao concreto, porque números por milhão de tokens só assentam quando os escalas. O número que reenquadrou isto para mim: uma carga de trabalho agêntica intensiva em saída que custa aproximadamente 1000 $/dia no Opus 4.8 aterra perto de 400 $/dia no Sonnet 5 com o preço padrão. Para um construtor solo a correr um agente, tanto faz. Para uma equipa a correr centenas de agentes em paralelo, é a linha entre "este produto tem unidade económica" e "este produto é um projeto científico".
Esta é a verdadeira história. Não é que o Sonnet 5 seja bom — muitos modelos são bons. É que o Sonnet 5 é bom o suficiente para fazer o Opus parecer opcional na maioria das cargas, custando menos de metade para as correr. Para quem ficou fora do orçamento do Fable e do Mythos, um modelo Claude capaz acabou de cair num orçamento que consegue mesmo defender.
Mas essa poupança de 60% é condicional. Há uma configuração que a pode apagar por completo, e a maioria das equipas não vai reparar até chegar a fatura.
A armadilha do nível de esforço de que ninguém te avisa
Aqui está a parte que justifica a existência deste artigo. O Sonnet 5 expõe níveis de esforço — low, medium, high, xhigh e max no topo do mostrador. Mais esforço significa que o modelo gasta mais tokens a raciocinar antes de responder. Mais tokens de raciocínio significam melhor qualidade e maior custo. Os tokens de saída são onde vive a fatura, e o raciocínio queima tokens de saída.
Se leste a minha análise dos níveis de esforço do Opus 4.8, já sabes que este mostrador importa mais do que a escolha do modelo em metade das vezes. Com o Sonnet 5 importa ainda mais, porque o mostrador é o que determina se estás a ter uma pechincha ou a pagar a mais.
Percorre isto pela ordem em que os resultados de pesquisa agêntica realmente se desenrolam:
Com esforço baixo, o Sonnet 4.6 ainda vence o Sonnet 5 na taxa de sucesso — o Sonnet 5 fica por volta dos 55% na tarefa de pesquisa agêntica. O Sonnet 5 é mais barato nesta definição, portanto trocas um pouco de precisão por uma fatura menor. Bom para trabalho tolerante e de grande volume.
Com esforço médio, os dois são comparáveis em qualidade, mas o Sonnet 5 faz por menos. É o ponto ideal — a definição onde "mais barato e pelo menos tão bom" é simplesmente verdadeiro, sem asteriscos.
Com esforço alto, o Sonnet 5 destaca-se claramente do 4.6 em qualidade. Mas o custo sobe, e aqui está o remate: um Sonnet 5 em esforço alto custa aproximadamente o mesmo que um Opus em esforço alto. Gastaste o caminho de volta até ao preço do Opus.
Em xhigh — e o Sonnet 5 vai ainda um degrau acima, para max — estás firmemente em terreno de preços do Opus. No topo do mostrador, o Sonnet 5 aterra perto da definição médio-a-alto do Opus 4.8 no OSWorld-Verified e no benchmark de pesquisa agêntica BrowseComp. Estás possivelmente a pagar mais do que o Opus para obter um resultado que apenas iguala a marcha do meio do Opus. Essa é a armadilha. Um Sonnet 5 no máximo é, para muitas tarefas, o pior dos dois mundos — dinheiro de Opus para tetos abaixo do Opus.
Portanto, a leitura ingénua — "o Sonnet 5 é mais barato, aumenta-o para poupar" — é exatamente ao contrário no topo do mostrador. As poupanças vivem no esforço baixo e médio. Empurra para o topo e muitas vezes só construíste um Opus mais lento e mais caro.
Essa assimetria é a coisa mais importante para interiorizar sobre este modelo, e é por isso que a resposta a "Sonnet 5 ou Opus 4.8?" nunca é plana.
Se preferires não ajustar este mostrador à mão numa frota de agentes — calcular orçamentos de esforço tarefa a tarefa é um trabalho genuinamente meticuloso —, é exatamente o tipo de arquitetura que construo para clientes através do meu perfil no Fiverr. Mas podes perfeitamente fazê-lo por ti, e a regra abaixo é por onde eu começaria.
Então quando é que o modelo mais barato vence de facto?
Tira a nuance e aqui está o quadro de decisão que agora uso. Não é "que modelo é melhor". É "de que precisa esta tarefa específica e onde é que isso me coloca na curva".
Vai buscar o Sonnet 5 quando:
- O trabalho é rotineiro a moderadamente complexo — geração de conteúdo, classificação, extração, sumarização, codificação de estilo CRUD padrão, a maior parte do trabalho de conhecimento. (Lembra-te: venceu o Opus no GDPval-AA v2.)
- Estás a correr em volume. Centenas de chamadas, agentes em paralelo, qualquer coisa em que o custo por chamada se acumule num número real.
- Há ferramentas no ciclo. O défice de raciocínio do Sonnet 5 face ao Opus quase se fecha assim que ele consegue pesquisar e chamar funções.
- Consegues viver em esforço baixo ou médio. É aqui que a vantagem de custo é real e incondicional.
Vai buscar o Opus 4.8 quando:
- A tarefa é codificação difícil e autónoma — refatorações multi-ficheiro, debugging peganhento, execuções longas de codificação agêntica. Aqueles seis pontos de diferença no SWE-bench Pro são reais e, em problemas genuinamente difíceis, compõem-se: a eficiência em tokens do Opus significa que muitas vezes chega à resposta em menos passos caros. Em tarefas de pesquisa agêntica e uso do computador de alta complexidade, o Opus entrega frequentemente melhores resultados a menor custo total do que um Sonnet 5 no máximo, precisamente porque não precisa do topo do mostrador para lá chegar.
- A precisão é inegociável e preferes não ficar de babysitter do resultado.
- Estavas prestes a pôr o Sonnet 5 em xhigh "para ir a jogo seguro". Se precisas desse teto, usa o Opus — é mais barato no topo e melhor.
A heurística limpa: o Sonnet 5 é dono da maioria de esforço baixo a médio da tua carga; o Opus 4.8 é dono da minoria de alto esforço e alta precisão. A maioria das equipas vai descobrir que a maioria é maior do que esperava, e é exatamente por isso que este lançamento importa. Para o quadro mais amplo da codificação agêntica em particular, fui a fundo no meu olhar prático sobre o Sonnet 5 para codificação agêntica — este artigo é o seu companheiro de custos-e-decisão.
Há mais uma dimensão que não aparece de todo no gráfico dos benchmarks e, para quem esteja a implementar agentes com permissões reais, pode ser a mais importante.
E quanto a segurança, alinhamento e ciber-segurança?
O custo-desempenho é o título. Mas se estás a entregar acesso a ferramentas, acesso a ficheiros ou um browser a um modelo, "como é que se comporta quando as coisas ficam adversariais" deixa de ser académico. Aqui está onde o Sonnet 5 fica, com a ressalva incluída.
As avaliações pré-implementação da Anthropic descobriram que o Sonnet 5 é, no geral, uma melhoria face ao Sonnet 4.6. Em segurança agêntica especificamente, é melhor a recusar pedidos maliciosos e mais resistente a tentativas de sequestro em ataques de injeção de prompt — o modo exato de falha que me tira o sono quando um agente tem acesso de escrita a alguma coisa. Na auditoria comportamental automatizada que sonda comportamentos desalinhados como engano e cooperação com uso indevido, o Sonnet 5 pontuou mais seguro do que o seu antecessor.
A ressalva honesta: o Sonnet 5 mostrou taxas de comportamento desalinhado algo mais altas do que o mais capaz Opus 4.8 e o Mythos Preview. Mais capacidade tem, até agora, correlacionado com melhor alinhamento nesta família, e o Sonnet 5 senta-se abaixo do Opus em capacidade. Portanto, se o teu caso de uso for genuinamente de alto risco e adversarial, é mais um voto para o Opus — não é impeditivo para o Sonnet 5, mas é um fator real.
Em ciber-segurança, as notícias são discretamente boas. A Anthropic não treinou deliberadamente o Sonnet 5 em tarefas cibernéticas. Ele lida com trabalho ciber rotineiro e não prejudicial, mas tem um desempenho substancialmente pior do que o Opus 4.8 e o Mythos 5 em capacidades perigosas como desenvolvimento de exploits de software. Essa fraqueza é aqui uma qualidade: o Sonnet 5 não carrega o tipo de capacidade de desenvolvimento de exploits que levou a Anthropic a impor restrições e escrutínio mais pesados ao Mythos (escrevi sobre esse episódio inteiro na análise do lançamento do Fable 5 e do Mythos 5). O resultado é um modelo mais direto e estável para implementar em larga escala. Também saiu com salvaguardas cibernéticas em tempo real ligadas por defeito — as mesmas que a Anthropic corre no Opus 4.7 e 4.8.
Balanço: para a esmagadora maioria do trabalho agêntico, o Sonnet 5 é seguro de implementar e melhor comportado do que o Sonnet que estavas a usar no mês passado. Para os cenários de maior risco e mais adversariais, o Opus mantém a vantagem. Mesmo padrão de tudo o resto nesta comparação — e não é coincidência.
Porque é que este lançamento é maior do que um modelo
Recua por um segundo, porque o argumento do por-token perde o ponto estratégico.
A Anthropic corre em direção a um grande IPO, e o Sonnet 5 lê-se como um modelo construído para o mercado de tokens da API tanto quanto para qualquer utilizador individual. O rácio custo-desempenho é o campo de batalha competitivo inteiro para inferência agora, e o Sonnet 5 é uma jogada direta para lá — capaz o suficiente para lidar com cargas de produção reais, barato o suficiente para ganhar competições contra rivais em preço.
Para o ecossistema, preenche o meio. Existe agora um modelo Claude genuinamente forte a assentar entre o nível de entrada e o teto do Opus/Fable/Mythos, apontado exatamente a toda a gente que olhou para os 10 $/50 $ do Fable e silenciosamente fechou o separador. Isso é muita gente. Muitas startups. Muitos agentes que de repente fazem contas.
E porque o Sonnet e o Opus partilham agora uma única curva de custo-desempenho, a conversa de arquitetura muda. Deixas de perguntar "de que nível é este produto?" e começas a perguntar "de que ponto na curva precisa cada tarefa?" — encaminhando tarefas baratas para o Sonnet 5 em esforço baixo, reservando o Opus para a minoria difícil. É uma forma mais sofisticada e mais eficiente em custo de construir, e o Sonnet 5 é o modelo que finalmente a torna prática.
A única coisa a fazer esta semana
Não aceites o meu quadro por fé — e não aceites os benchmarks por fé também. São direcionais, não são evangelho para a tua carga.
Aqui vai a experiência de 30 minutos. Escolhe uma tarefa que o teu sistema execute muito. Corre-a três vezes: Sonnet 5 em esforço médio, Sonnet 5 em esforço alto e Opus 4.8. Regista a qualidade do resultado e o custo em tokens de cada uma. Quase de certeza vais encontrar uma de duas coisas — ou o Sonnet 5 em esforço médio chega e sobra e acabaste de cortar o custo dessa tarefa em 60%, ou a tarefa precisa mesmo do Opus e agora tens prova em vez de palpite. Qualquer das respostas vale trinta minutos.
Lembra-te de onde isto começou: o meu atalho preguiçoso de dois níveis, "tarefa importante, ir buscar o Opus". O Sonnet 5 não matou esse instinto — afiou-o. A pergunta já não é que modelo. É que ponto na curva, tarefa a tarefa. Acerta nesse encaminhamento e vais correr a maior parte do teu trabalho a 40% do custo com uma qualidade que não distingues, gastando dinheiro de Opus apenas onde realmente te compra alguma coisa.
O barato vence mais vezes do que se pensa. Só não no topo do mostrador.
Perguntas Frequentes
O Claude Sonnet 5 é melhor do que o Opus 4.8?
No geral não — mas mais perto do que a diferença de preço sugere. O Sonnet 5 fica atrás do Opus 4.8 por apenas uns pontos na maioria dos benchmarks e chega a vencê-lo em trabalho de conhecimento (GDPval-AA v2: 1618 vs 1615). O Opus mantém uma vantagem clara em codificação agêntica difícil (SWE-bench Pro: 69,2% vs 63,2%). Para o quadro de decisão, vê "Então quando é que o modelo mais barato vence de facto?" acima.
Quanto custa o Claude Sonnet 5 face ao Opus 4.8?
O Sonnet 5 fica a 2 $ de entrada / 10 $ de saída por milhão de tokens (preço introdutório até 31 de agosto de 2026), depois 3 $/15 $. O Opus 4.8 fica a 5 $/25 $. Portanto, o Sonnet 5 corre a cerca de 40% do custo de entrada do Opus e a menos de metade do custo de saída — uma carga intensiva em saída que custa 1000 $/dia no Opus aterra perto de 400 $/dia no Sonnet 5.
O que é a armadilha do nível de esforço do Sonnet 5?
Nas suas definições de esforço mais altas (xhigh e max), o Sonnet 5 pode custar tanto ou mais do que o Opus 4.8 enquanto apenas iguala a qualidade médio-a-alta do Opus. A vantagem de custo vive no esforço baixo e médio — empurra o mostrador até ao topo e muitas vezes pagas dinheiro de Opus por um teto abaixo do Opus. Análise completa na secção "A armadilha do nível de esforço" acima.
É seguro implementar o Claude Sonnet 5 para agentes?
Sim para a maioria dos casos de uso. O Sonnet 5 é melhor do que o Sonnet 4.6 a recusar pedidos maliciosos e a resistir a sequestros por injeção de prompt, e foi lançado com salvaguardas cibernéticas em tempo real ligadas por defeito. A ressalva: mostra taxas de comportamento desalinhado algo mais altas do que o Opus 4.8, portanto as cargas adversariais de mais alto risco continuam a favorecer o Opus.
Quando é que o Claude Sonnet 5 saiu?
O Claude Sonnet 5 foi lançado a 30 de junho de 2026, como modelo por defeito para os planos Free e Pro, e está disponível para utilizadores Max, Team e Enterprise, mais via API.
Antes de escolheres um modelo
Se estás a ligar o Sonnet 5 e o Opus 4.8 ao mesmo sistema e queres os orçamentos de esforço por tarefa afinados antes que a fatura te ensine à custa da carteira, esse encaminhamento custo-versus-qualidade é exatamente o tipo de trabalho que faço — contacta-me aqui. Corre primeiro a experiência de 30 minutos acima, no entanto. Metade das vezes diz-te que o Sonnet 5 em esforço médio já tinha o trabalho tratado.