Conform Anthropic.com: Claude Opus 5 revoluționează piața de inteligență artificială cu performanță crescută la jumătate de preț
Compania Anthropic a lansat oficial astăzi Claude Opus 5, un model de inteligență artificială care promite să redefinească standardele în domenii precum programarea și munca de cunoaștere. Noul model oferă performanțe comparabile cu modelele de vârf, precum Claude Fable 5, dar la un cost semnificativ mai redus, jumătate din prețul anterior. Opus 5 stabilește noi recorduri pe platforme de evaluare precum Frontier-Bench și GDPval-AA, confirmându-se ca un motor de calcul de ultimă generație.
Modelul Opus 5 este conceput pentru utilizarea zilnică, prioritizând eficiența. Acesta devine noul model implicit pe Claude Max și cel mai puternic model disponibil pe Claude Pro, sugerând o adopție rapidă în ecosistemul Anthropic.
Performanță și eficiență remarcabilă pe sarcini complexe
Claude Opus 5 demonstrează o îmbunătățire substanțială a performanței, menținând în același timp costurile de operare la nivelul predecesorului său, Opus 4.8. Testerii au posibilitatea de a optimiza modelul fie pentru o inteligență sporită, fie pentru a conserva resursele computaționale, obținând astfel rezultate mai rapide și mai economice.
În sarcinile de inginerie software, Opus 5 excelează. Pe benchmark-ul Frontier-Bench v0.1, acesta depășește toate celelalte modele și își dublează performanța față de Opus 4.8, la un cost per sarcină mai mic. De asemenea, pe CursorBench 3.2, la efort maxim, modelul ajunge la performanțe la doar 0,5% distanță de scorul maxim al lui Fable 5, dar la jumătate de preț.
Rezultatele sunt similare în sarcini de lucru bazate pe cunoștințe și de rezolvare a problemelor. Evaluarea ARC-AGI 3, care implică soluționarea unor probleme noi, arată că Opus 5 obține un scor de trei ori mai mare decât următorul cel mai performant model. Pe Zapier AutomationBench, care vizează finalizarea sarcinilor de afaceri complexe, rata de succes a lui Opus 5 este cu aproximativ 1,5 ori mai mare decât a concurenței, la același cost per sarcină.
Abordare proactivă și analiză aprofundată în soluționarea problemelor
Opus 5 se distinge prin abilitatea sa de a verifica munca proprie și de a itera până la succes. În testările inițiale și evaluări, au fost identificate numeroase cazuri în care modelul a demonstrat agilitate și rigoare. De exemplu, într-o sarcină de pe Frontier-Bench, unde modelul a primit o imagine cu o piesă de mașină și a trebuit să scrie cod pentru a o recrea ca model 3D, dar fără a avea acces direct la vizualizarea imaginii, Opus 5 a dezvoltat un pipeline de viziune computerizată pentru a extrage geometria din pixeli și a reconstituit complet piesa.
Un alt exemplu notabil este identificarea și remedierea unei erori complexe într-un manager de pachete open-source popular. Opus 5 a identificat cauza principală și a corectat un caz particular pe care patch-ul comunității îl ratase, în timp ce un model concurent a remediat doar simptomul superficial.
Un inginer dintr-o firmă de tranzacționare a utilizat Opus 5 pentru a construi un flux de date de piață pentru un nou exchange într-o singură sesiune. Modelul a mers chiar mai departe, creând propriul sistem de testare pentru a valida corectitudinea codului.
Focus pe siguranță și aliniere la principii
În ceea ce privește alinierea cu principiile etice și siguranța, Opus 5 prezintă îmbunătățiri notabile. Testele automate de audit comportamental indică faptul că Opus 5 este cel mai aliniat model de până acum, respectând mai bine „Constituția Claude” decât predecesorii săi. Acesta manifestă rate scăzute de comportament deceptionant și este mai puțin susceptibil la exploatări malițioase.
Modelul nu avansează capabilități percepute ca fiind riscante sau cu dublă utilizare. Evaluările riguroase, desfășurate în parteneriat cu sectorul privat și guvernamental, indică faptul că Opus 5 rămâne în urma modelului Mythos 5 în cercetarea în domeniul biologiei și în securitatea cibernetică ofensivă. Cu toate acestea, Opus 5 se apropie de Mythos 5 în identificarea vulnerabilităților cibernetice, deși este considerabil inferior în exploatarea acestora.
Disponibilitate și noi funcționalități
Claude Opus 5 este disponibil începând de astăzi pe toate platformele Anthropic, la un preț de 5 $ per milion de tokeni de intrare și 25 $ per milion de tokeni de ieșire, același tarif ca pentru Opus 4.8. Dezvoltatorii pot accesa noul model prin API-ul Claude, sub denumirea „claude-opus-5”. De asemenea, este disponibilă o versiune „Fast mode”, care funcționează de aproximativ 2,5 ori mai rapid, la un tarif dublu față de prețul de bază.
Odată cu lansarea Opus 5, Anthropic introduce și două actualizări beta: modificări de instrumente în timpul conversațiilor pe platforma Claude, permițând dezvoltatorilor să schimbe instrumentele utilizate de Claude fără a invalida cache-ul prompt-ului, și mecanisme automate de fallback pe API. Acestea permit ca solicitările semnalate de clasificatorii de siguranță să fie rutate către alte modele, în loc să fie blocate.
Sursa: Anthropic.com
