Anthropic lança modelo de IA Claude Opus 5.5 para melhorar desempenho e eficiência

·por TechRitual Editorial·Notícias
Anthropic lança modelo de IA Claude Opus 5.5 para melhorar desempenho e eficiência
✏️ Conteúdo original| TechRitual World Redação

Anthropic lançou o seu mais recente modelo de inteligência artificial Claude Opus 5.5. Esta nova versão foi lançada cerca de dois meses após a última atualização do modelo Opus, seguindo o ritmo habitual de atualizações da Anthropic. Atualmente, a Anthropic oferece vários modelos de IA diferentes, que incluem principalmente Haiku (o mais pequeno e barato), Sonnet (de tamanho e preço intermédios) e Opus (o maior e mais caro dos três modelos). Além disso, existe o Fable/Mythos, que é uma opção de gama alta com mais capacidades e custos.

A presente atualização eleva o modelo Opus de Claude da versão 5 para a versão 5.5. A Anthropic afirma que o Opus 5.5 é o primeiro modelo lançado após um apelo por desenvolvimentos de ponta. Tal como os modelos anteriores, foi testado por avaliadores externos antes do lançamento, incluindo a METR e a Frontier Design. Nos nossos testes de alinhamento mais abrangentes, alcançou a pontuação mais forte até agora.

Opus 5.5 apresenta melhorias significativas de desempenho

A Anthropic afirma que o desempenho do Opus 5.5 representa um avanço significativo em comparação com o Opus 5. Este é um modelo de ponta totalmente novo, e os testadores iniciais testemunharam um enorme salto de desempenho nas suas tarefas mais complexas. Um dos testadores completou uma migração de código de 680.000 linhas em menos de um dia, uma tarefa que normalmente requer semanas de uma equipa de engenheiros. O modelo destacou-se na identificação e correção de ineficiências no software: quando pedimos que reduzisse o tempo de carregamento de cada página de uma aplicação web, o Opus 5.5 teve sucesso em 39 de 40 tentativas, enquanto as melhorias do Opus 5 foram menores e alteraram o comportamento da aplicação.

Além disso, um testador diferente fez com que vários modelos de Claude criassem um jogo a partir de um único prompt; o Opus 5.5 obteve pontuações mais altas em termos de força gráfica e estética do que todos os outros modelos.

Especificamente em termos de codificação, a Anthropic afirma que o Opus 5.5 é particularmente eficaz em tarefas longas e complexas, como a migração e auditoria de um repositório de código completo. Um testador inicial utilizou-o para auditar e corrigir um repositório de 200.000 linhas em menos de três horas, enquanto o Opus 5 necessitou de mais de 20 horas e utilizou 2,5 vezes mais tokens. Numa teste interno, pedimos ao Opus 5.5 e ao Fable 5.1 que traduzissem o software amplamente utilizado HAProxy da linguagem C para Rust.

Ambas as reescritas passaram quase todos os testes de regressão do próprio HAProxy, mas o Opus 5.5 levou 9,5 horas, enquanto o Fable 5.1 demorou 12 horas, resultando numa redução de custos de 51%. O Opus 5.5 oferece resultados de ponta a um custo mais baixo durante a codificação autónoma.

Opus 5.5 apresenta melhor relação custo-benefício do que a versão anterior

Com o seu nível de esforço padrão, o Opus 5.5 tem um custo por tarefa de cerca de 20% do GPT-6 Astra. Nos testes do Terminal Bench 4.0, o seu desempenho é comparável ao do Astra, mas o custo é cerca de 40%, enquanto nos testes do CursorBench, ele supera o GPT-5.6 Sol em 11 pontos, com um custo de cerca de um terço. Além disso, a precificação do Opus 5.5 é mais vantajosa em comparação com o Opus 5 ajustado: o Opus 5.5 requer menos recursos computacionais do que o Opus 5, e a sua precificação reflete isso.

Os nossos testes mostram que, com as configurações padrão, o Opus 5.5 tem um custo 40% inferior ao do Opus 5 em cargas de trabalho típicas. Os custos de marcação de entrada e saída são, respetivamente, de $4 e $20 por milhão, 20% inferiores ao do Opus 5. A leitura de cache (que representa a maior parte dos custos de trabalho autónomo e de codificação) é de $0.20 por milhão, 60% inferior ao do Opus 5. A velocidade de geração de saída do Opus 5.5 também é mais de 30% mais rápida do que a do Opus 5.

Além da redução de preços, iremos aumentar o limite de utilização em cinco horas nos planos Pro, Max e Team. Também oferecemos aos utilizadores subscritos a redefinição do limite de taxa, que agora pode ser guardada e utilizada a qualquer momento. O novo modelo Claude Opus 5.5 já foi lançado. Olhando para o futuro, a Anthropic anunciou que os modelos Claude Sonnet 5.5 e Claude Haiku 5.5 serão lançados nas próximas semanas, com muitas das mesmas melhorias em desempenho, eficiência e segurança.

ItemEspecificações
Capacidade de migração de código680,000 linhas de código concluídas em menos de um dia
Tempo de auditoria de código200,000 linhas de código concluídas em menos de três horas
Tempo de tradução HAProxy9.5 horas (abaixo das 12 horas do Fable 5.1)

Ler o artigo original em techritual.com (chinês tradicional)

T
Sobre o autor
TechRitual Editorial

The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.