Claude Opus 5.5

Claude Opus 5.5 se je pravkar uvrstil na 1. mesto na Code Arena - zdaj med najboljšimi kandidati za kodiranje umetne inteligence

Kratek odgovor: Claude Opus 5.5 ima najvišjo stopnjo in je na Arena.ai Code Arena WebDev s 1818 točkami na prvem mestu in je na vrhu lestvice Artificial Analysis Coding Agent Index s 66 točkami pri največjem trudu. To so javni termometri, ne vaš zaostanek. Če se s kodo preživljate, pred preklapljanjem med privzetimi nastavitvami na kratko preizkusite svoje naloge.

Ključne ugotovitve:

Vodilni v Code Arena: Elo WebDev 1.818 obravnavajte kot prednostno moč, ne kot produkcijski dokaz.

Vrh indeksa agenta: Rezervirajte Opus z največjim naporom za lepljive zahteve, kjer je neuspeh drag.

Kompromis stroškov: Žetoni za dnevnik in stenska ura; najvišji rezultat in poceni rezultat se razlikujeta.

Najprej preizkusite: Sami preizkusite eno gradnjo uporabniškega vmesnika, eno refaktoriranje in eno dolgo sejo agenta.

Krona se vrti: Ohranite cenejšo privzeto vrednost za delo na večjih količinah v vseh ciklih izdaje.

Prevzem lestvice najboljših, preprosto razloženo

Arena.ai je Claude Opus 5.5 (Max) uvrstila na prvo mesto v lestvici WebDev na platformi Code Arena z 1818 točkami. To je približno šestindvajset točk pred naslednjim modelom v razpravi, GPT-6 Astra Max, in pomeni precejšen skok v primerjavi s prejšnjim Opusom 5 Max, ki je dosegel blizu 1692 točk. To so objavljene številke na plošči, ne nekaj, kar bi neodvisno ponovno preizkusil v hermetičnem laboratoriju. Kljub temu je ~126-točkovni napredek na ravni Max iste družine tista vrsta delte, zaradi katere ljudje osvežijo lestvice Elo kot športne rezultate.

Artificial Analysis ločeno poroča, da je Opus 5.5 novi številka ena na svojem indeksu kodnih agentov, z izboljšavami v vseh spremljanih evalvacijah. Pri maksimalnem naporu znotraj Claude Code je model na tem indeksu dosegel 66 točk - najvišjo oceno, ki so jo doslej izmerili. V opombi je skrit en zamik: stroški na nalogo so višji, ko se tako močno potrudite. Najvišji rezultat in najnižji rezultat nista ista stvar.

Če združite ta dva signala, dobite zgodbo, ki je najpomembnejša: ne "model, predstavljen", temveč "programske plošče, ki so bile na hitro zamenjane". Obvestila o lansiranju so v medijih. Prevzemi lestvic najboljših so tisto, kar napredni uporabniki posnamejo v skupinske klepete izven delovnega časa.

  • Koda Arena.ai Arena WebDev: Opus 5.5 (Max) prijavljen pri 1.818
  • Vrzel v primerjavi z naslednjim imenovanim tekmecem v pokritosti: približno +26 v primerjavi z GPT-6 Astra Max
  • Skok v primerjavi s prejšnjim Opusom 5 Max: od ~1.692 do 1.818
  • Indeks kodirnega agenta za umetno analizo: nov #1; 66 pri največjem naporu v Claude Code
  • Ista indeksna opomba: višji stroški na nalogo pri tej nastavitvi napora

Poročan posnetek: Opus 5 Max proti Opus 5.5 Max na Code Areni

Primerjalne tabele so v pomoč, kadar je vir sestavljen izključno iz razpoloženja in posnetkov zaslona. Spodaj je preprosto poročilo o posnetkih, ne pa neodvisen pregled. Celice so nekoliko neenakomerne, ker so javne table vedno takšne – in ker je že samo poimenovanje »Max« dovolj, da se vam zmešajo oči.

Model (kot je bilo sporočeno) Deska / steza Točke / rezultat Kaj ljudje v tem berejo
Claude Opus 5 Max (prejšnji) Arena.ai Koda Arena - Spletni razvoj ~1.692 (poročano) Močno, a ne več na naslovnici
Claude Opus 5.5 (maks.) Arena.ai Koda Arena - Spletni razvoj 1.818 (poročano št. 1) Čist zgornji del; velik korak v primerjavi s prejšnjim Maxom
GPT-6 Astra Max Klepet z isto kodo Arena WebDev ~1.792, če odštejete vrzel ~26 (poročano kadriranje) Tesno drugo mesto v postih, ki se uvrščajo v kroge
Opus 5.5 z največjim naporom Indeks kodirnega agenta za umetno analizo 66 (najvišja vrednost, ki so jo izmerili, glede na njihovo poročilo) Najvišji rezultat kodiranja agenta - poraba je bila opažena
Manj napora / cenejše vožnje Ista širša slika kodiranja Tukaj ni niti ene javne magične številke Kompromisna cona: "dovolj dobro" proti "maksimalnemu doseganju cilja"

Nekaterim bralcem se zdi, da je tabela že dovolj, da kronajo zmagovalca. Ni. Elo in indeksi agentov so priročni termometri. Niso vaš produkcijski zaostanek.

Kaj Code Arena meri pod pokrovom

Če berete samo uvrstitev, zgrešite obliko testa. Code Arena, zlasti različica WebDev, ki jo ljudje navajajo, je zgrajena na primerjalnih preferencah pri nalogah kodiranja in gradnje vmesnikov. Ljudje (in glasovalni mehanizmi arene) izbirajo zmagovalce med rezultati modelov. To nagrajuje kodo, ki je videti pravilno, deluje čisto v demonstracijah in se zdi dodelana v slepi primerjavi – struktura sprednjega dela, interaktivnost, vizualna skladnost, tisto, zaradi česar predogled localhost kriči "pošlji ga".

To je drugačen šport kot statični izpit iz programiranja z izbirnimi odgovori. Prav tako se razlikuje od dolgoročnega ocenjevanja agentov, kjer mora model vzdrževati sejo lupine živo za številne klice orodij, ne da bi se pri tem potisnil v kot. Model lahko kljub precejšnjemu izzivu uporabniškega vmesnika naleti na zapleteno migracijo monorepozitorija, ki zahteva tri pripete knjižnice in nestabilno zbirko testov, dogovorjeno kot situacija s talci.

Ko je Opus 5.5 na WebDevu dosegel 1.818, to berite kot prednostno nalogo glede vrst gradenj, ki jih vidijo volivci v Areni. Hitre aplikacije, igre, snemalne knjige in vizualni uporabniški vmesniki z lokalnim gostovanjem se skoraj preveč dobro ujemajo s tem pasom – kar se ujema z nočnimi demonstracijami, ki preplavljajo časovnice. Preference Elo ni laž. Je specifična vrsta resnice. Obravnavajte ga kot degustacijske menije, ne kot popolno prehransko ploščo.

Še ena posebnost: označevanje najvišje ravni. Večji napor/večja zmogljivost pogosto pomenijo več žetonov, več računalništva in več potrpljenja. Plošče, ki prikazujejo različice Max, prikazujejo zgornjo mejo, ne pa vsakodnevnega klica API-ja, ki ga opravite med gledanjem stand-upa. Zgornja meja je pomembna. Pomembni so tudi dnevni stroški gonilnikov. Upoštevajte obe misli.

Indeks kodirnega agenta in kompromis med stroški in vrhom

Indeks kodirnih agentov podjetja Artificial Analysis je drugi steber te zgodbe o porastu. Njihovo poročilo uvršča Opus 5.5 na vrh, z izboljšavami v vseh spremljanih evalvacijah in izstopajočimi 66 pri maksimalnem naporu v Claude Code. Najvišja vrednost, ki so jo izmerili, je močan stavek. Priložena je tudi opomba za odrasle: stroški na opravilo se dvignejo, ko pritisnete na plin.

To je bistvo argumenta o najboljšem modelu za ekipe s proračuni. Model, ki zmaga z maksimalnim naporom, lahko še vedno izgubi teden, če vsaka naloga porabi majhno premoženje v žetonih. Krožijo govorice, ki že omenjajo, da nekateri uporabniki opažajo porabo žetonov pri dolgih sejah. To ne izniči rezultata. Spremeni okvir odločitve o izdelku: maksimalen napor rezervirajte za neprijetne zahteve in ohranite cenejši profil za kodo za povezovanje, refaktoriranje in delo »naredite ta gumb manj grd«.

Predstavljajte si, kot da najamete ostrega izvajalca, ki zaračunava po urah in govori hitro. Želite, da se ukvarjajo s težkim problemom. Ne želite, da prepisujejo vsak dokument README. Najvišji rezultat agenta je trditev o zmogljivosti. Stroški na nalogo so trditev o operacijah. Najboljša koderska umetna inteligenca za solo indie hekerja ob 1. uri zjutraj ni samodejno najboljša koderska umetna inteligenca za podjetje, ki spremlja ekonomijo enote. Obe skupini kričita o istem posnetku zaslona lestvice najboljših.

  • Uporabite maksimalen trud, kadar je naloga lepljiva, zahteva več datotek in je neuspeh drag
  • Zmanjšajte glasnost, ko je naloga rutinska in potrebujete glasnost
  • Spremljajte svoj lastni strošek na združeni PR, ne le javnega ELO-ja
  • Pričakujte, da se bodo indeksi agentov in Elo arene včasih razlikovali – različni športi

Čez noč odziv razvijalcev: Aplikacije, igre in energija "Ne nerfaj"

Številke pojasnjujejo naslove. Predstavitve pojasnjujejo razpoloženje. Razvijalci objavljajo hitre aplikacije z lokalnim gostovanjem, drobne igre, snemalne knjige in gradnje uporabniškega vmesnika/vizualnih elementov, ki so videti, kot da bi v prejšnjem četrtletju potrebovali cel vikend. Delno je to posledica pristranskosti pri izbiri – ljudje delijo zmagovalce, ne pa treh neuspešnih generacij, ki so bile prve. Kljub temu je količina objav v slogu »počakajte, to je delovalo gladko« delno razlog, zakaj se to zdi kot porast in ne kot tiha objava popravka.

Cikel šal je že zrel: prosim, ne oslabite Opusa 5.5. Ta šala se pojavi le, ko se model v divjini počuti skoraj preveč dobro ali ko so pretekle izdaje ljudi naučile, da varnostne posodobitve in posodobitve izdelkov včasih omrtvijo ostrino. Ali prihaja kakšna oslabitev ali ne, ni pomembno. Mem je preverjanje temperature glede na razpoloženje. Trenutno ta merilnik žari.

Tudi platforme se spreminjajo. Questflow je na primer že večkrat napovedal nadgradnje z Opusa 5 na 5.5. Ko prodajalci orodij hitro objavijo nadgradnjo, je to znak, da je povpraševanje oprijemljivo in da prejšnja raven že velja za privzeto različico prejšnjega tedna. Hitrost integracije je že sama po sebi nekakšna ocena: produktne ekipe ne prepisujejo izbirnikov modelov za šport.

Anekdotične gradnje so reakcija razvijalcev, ne nadzorovane revizije. To razlikovanje imejte vtetovirano na čelu. Čudovita predstavitev scenarija ne dokazuje zanesljivosti podjetja. Dokazuje pa, da kreativni delovni procesi kodiranja doživljata sladkorno mrzlico – in sladkorna mrzlica spreminja, kaj ljudje poskusijo naprej.

Zakaj številka ena ne pomeni samodejno "najboljše koderske umetne inteligence" za vsakodnevno delo

Kratek odgovor: za nekaj dela, za nekaj tednov. Daljši odgovor: najboljši je beseda za portfolio, ki se pretvarja, da je trofeja.

Če je vaš dan v slogu spletnega razvoja – ciljne strani, interaktivni prototipi, vizualno dodelava, hitre igre, poteki dela v slogu snemalne knjige – je potencialna stranka za spletno razvojno platformo Code Arena zelo pomembna. Zmagovalci preferenc so običajno videti dobro v brskalniku, in dober videz v brskalniku je v tem primeru polovica dela. Če je vaš dan agentsko kodiranje v zapleteni kodni bazi z orodji, lupinami in dolgimi sejami, je vrh indeksa kodnih agentov bolj zanimiv signal – s še vedno priloženim opozorilom glede stroškov.

Če je vaš dan sestavljen iz najtežjih nalog na svetu – novih algoritmov, varnostno kritičnih sistemov, zavezanih zapuščenih skladov z plemenskim znanjem – krožeči uporabniški zapiski že pravijo, da Opus 5.5 še vedno zaostaja pri najtežjih problemih in da lahko kuri žetone, ko se seje vlečejo. To ni zavajanje. Gre za znani vzorec meje: povprečen primer poskoči, patološki primer ostane patološki. To je morda najmanj glamurozen stavek v celotnem članku in morda najbolj praktičen.

Upoštevajte tudi, da konkurenca izdaja v istem tednu. Chatter je omenil izdaje OpenAI GPT-6 razreda Sol/Luna v istem naletu. Ko več laboratorijev pade v nekaj dneh narazen, se lestvice najboljših spremenijo v vrata, ki se vrtijo. Današnja številka 1 je lahko jutrišnja "še vedno odlična, ampak poglejte si ta drugi grafikon". Najboljše je začasno. Pragovi zmogljivosti se ponavadi trajnejše zvišujejo. Stavite na zaskočni mehanizem, ne na posnetek zaslona.

Trditve o izdelkih v obtoku (ravnajte previdno)

Zunaj forumov kroži po običajnih kanalih vrsta trditev o izdelkih. Pripišite jih kot trditve, ki krožijo, ne pa kot preverjene laboratorijske rezultate iz tega članka:

Trditev o stroških razreda Fable je še posebej pikantna, ker poskuša hkrati prodati kakovost in varčnost. Če to drži pri vaši delovni obremenitvi, je to velika stvar za vsakogar, ki je prej menil, da je kakovost na ravni Opusa cenovno ugodna kot fensi večerja vsak večer. Če to ne drži pri vaših navodilih, boste to občutili na računu, preden boste to občutili na Elo. Osebna delovna obremenitev > trženjska sosednost. Vedno.

Trditev, ki se najbolj natančno ujema z zgodbo o umetni analizi, je močnejša uporaba računalnika in agentno kodiranje. Agenti, ki lahko poganjajo orodja, klikajo in ohranjajo koherentnost stanja, so oblika izdelka, ki si jo želi veliko graditeljev. Preference Elo na WebDevu in vrhovi indeksa agentov se lahko rimajo, ne da bi bili identični dvojčki. Ko se rimajo, ljudje postanejo glasni. Ko se kasneje razhajajo, ljudje postanejo cinični. Živite v sredini.

Istetedenski prepir: Zakaj čas okrepi vse

Opus 5.5 ni prišel v tihi puščavi novic. Izšel je pred kratkim, v istem tednu kot konkurenčni modeli, ki jih govorice nenehno združujejo – vključno z omembami OpenAI GPT-6 Sol/Luna. Ta gneča je pomembna. Gneča v tednih ustvarja primerjalne posnetke zaslona. Primerjalni posnetki zaslona ustvarjajo plemenske tabore. Plemenski tabori ustvarjajo iluzijo, da en grafikon naseljuje civilizacijo.

Prav tako ustvari zgovoren stresni test. Ko se hkrati pojavi več močnih modelov, jih razvijalci v nekaj urah A/B-preizkusijo v istih aplikacijah za igrače. Čez nočni razcvet lokalnega gostovanja je deloma posledica tega stresnega testa, ki uhaja na družbena omrežja. Gledate porazdeljeno peko z grozno metodologijo in odlično zabavno vrednostjo. To ni znanost. Še vedno lahko nosi signal, če pomežiknete in odmislite pristranskost pri izbiri.

Za Anthropic je doseganje prvih mest na Code Areni in Coding Agent Indexu med tem prerivanjem odličen časovni potek – oziroma odlična kakovost modela, ki je videti kot časovni potek. Kakorkoli že, zgodba se je obdržala: porast kodiranja, ne le objava za začetek.

Kaj naj gradbeniki storijo s tem

Praktični priročnik, brez misticizma:

  • Izvedite lastno tridelno prenovo: eno gradnjo uporabniškega vmesnika, eno preoblikovanje več datotek in eno dolgo sejo agenta
  • Žetoni za dnevnike in stenska ura, ne le "ali je delovalo"
  • Arena.ai in Artificial Analysis obravnavajte kot primarna javna termometra za zgodbo o uvrstitvah
  • Za obsežnejša opravila obdržite cenejši privzeti model
  • Če uporabljate platforme, kot je Questflow, ki so že prešle na različico 5.5, si oglejte, kako se bodo spremenili vaši obstoječi delovni tokovi, preden vse prepišete
  • Prezrite poskuse "najboljši za vedno"; ponovno si oglejte čez nekaj izdajnih ciklov

Če se naloga uporabniškega vmesnika pokvari in dolga seja agenta postane draga, imate odgovor v enem popoldnevu. Če sta tako povpraševanje kot stroški v redu za vaše merilo, čestitamo – morda imate novo privzeto nastavitev. Če najtežja naloga še vedno ne uspe, ste se naučili nekaj, česar vam lestvice najboljših nikoli ne bi povedale. To je celotna igra. Nekoliko suhoparno. Izjemno praktično.

Ena nepopolna metafora, saj jo morajo ti članki po kozmičnem zakonu imeti: obravnavanje enega samega Elo vodje kot "najboljše koderske umetne inteligence" je kot kronanje najboljšega kuharja na svetu, ker je zmagal na tekmovanju v sladicah. Sladice so pomembne. Enako velja za kuhanje večerje za dvanajst izbirčnih sorodnikov z razbito pečico. Vaš repozitorij so sorodniki.

Kako se to ujema s širšo oboroževalno tekmo med kodiranjem in umetno inteligenco

Pomanjšajte povečavo in vzorec je znan. Laboratoriji se odpremijo. Plošče se premešajo. Razvijalci preplavijo nov strop. Prodajalci orodij nadgradijo privzete nastavitve. Nekdo objavi osupljivo mini igro. Nekdo drug objavi napako zaradi grde napake. Mediana zmogljivosti se dvigne, tudi ko krona zamenja glavo.

Kar se tukaj zdi sveže, je signal z dvema ploščama in opomba o stroških, ki potuje s slavo. Minili smo čas, ko je lahko en sam klepetalni primerjalni test nosil celotno zgodbo. Kodiranje je v praksi večmodalno: pisanje, urejanje, brskanje, klikanje, zagon, ponovni poskus. Indeksi, ki se opirajo na agentiko, in arene, ki se opirajo na preference spletnega razvoja, lovijo različne dele tega. Ko en model vodi oba dela hkrati, se porast pogovorov napiše sam.

Nihče, ki piše z bistrim očesom, ne ve, ali bo Opus 5.5 ostal na vrhu. Konkurenčni nivoji Max so na spletni strani WebDev že na dosegu roke, če se ohrani okvir vrzeli v ~26 točkah. Tudi tako majhne vrzeli se lahko obrnejo. Zmogljivost, ki se v demo različicah zdi "čez noč boljša", je lahko nekaj tednov kasneje, ko se vsi prilagodijo, še vedno nova normalnost. Zanimivo in trajno vprašanje ni krona. Gre za to, ali se razmerje med kakovostjo agentnega kodiranja in ceno še naprej povečuje za običajne razvijalce. Pri tem vprašanju je nov izmerjeni vrh 66 z izrecnim opozorilom o stroških bistro in trženjsko usmerjeno poročanje. Zasluge si zaslužijo.

Bistvo

Claude Opus 5.5 s svojo stopnjo Max zaseda prvo mesto na lestvici Code Arena WebDev pri Arena.ai z 1818 točkami, kar je približno šestindvajset točk pred naslednjim imenovanim tekmecem v pokritosti in precej nad prejšnjim Opus 5 Max, ki je dosegel skoraj 1692 točk. Artificial Analysis poroča, da je novi #1 na indeksu kodirnih agentov, z 66 točkami pri maksimalnem trudu v Claude Code - kar je njihov najvišji dosežek doslej - ter opombo, da se stroški na nalogo zvišujejo s tem trudom. Odziv razvijalcev je glasen: hitre aplikacije za lokalnega gostitelja, igre, snemalne knjige, gradnje uporabniškega vmesnika, šale o "ne oslabljanju" in nadgradnje platforme, kot je selitev Questflow iz Opusa 5 na 5.5. Krožijo trditve o zgodbi razreda Fable z nižjimi stroški, močnejšem mnenju o uporabi agentov/računalnikov in znanih opozorilih glede zahtevnih nalog in porabe žetonov.

Javne uprave pravijo, da Opus 5.5 trenutno vodi pri nalogah s preferencami v obliki spletnega razvoja in kodiranju agentov, ki zahtevajo veliko truda. Za vaše specifične zahteve glede repozitorija, proračuna in nočnih mor morate še vedno izvajati peko. Krone se vrtijo. Orodja se seštevajo. Uporabite val, ne častite ga. In morda ohranite drugi model na toplem, ko bo račun začel izgledati kot preobrat v zgodbi.

Praktičen primer: Izvedba tridelnega preizkusa Opus 5.5 pred spremembo privzetih nastavitev

Posnetki zaslona lestvice najboljših o Claude Opus 5.5, ki se je pravkar uvrstil na 1. mesto na Code Arena - zdaj med najboljšimi kandidati za kodiranje umetne inteligence. Termometri so, ne pa vaš zaostanek. Takole je britanski samostojni razvijalec full-stacka spremenil nočni porast Elo v enopopoldansko peko - ena gradnja uporabniškega vmesnika, eno preoblikovanje več datotek, ena dolga seja agenta - preden je preklopil kateri koli privzeti izbirnik modela.

Scenarij

Riley za stranski projekt SaaS dostavi ciljne strani strank in obsežen monorepozitorij React/Node. Potem ko so objave na Arena.ai Code Arena WebDev in klepet o indeksu kodnih agentov Artificial Analysis okronali Opus 5.5 (Max), se je Slack napolnil z energijo »za vse uporabite Max«. Rileyjevi računi že tako pečejo na dolgih sejah, zamenjava »najboljši za vedno« v prejšnjem četrtletju pa jih je prisilila, da so dvakrat na mesec prepisali pozive.

Javne table ohranjajo kot kontekst – na WebDevu jih je bilo zabeleženih 1818, vrh indeksa agentov z opombo o stroških – in zavračajo obravnavo Elo kot razsodbe o produkciji. Načrt: tri fiksne naloge na Opusu 5.5 z normalno nastavitvijo napora in, le če je potrebno, en prehod Max/max-effort na lepljivi zahtevki. Žetoni dnevnika, stenska ura in ali je sprememba pristala v glavnem delu. Cenejši model ostane topel za delo z lepilom.

Cilj je osebna definicija "najboljšega": kakovost na združeno spremembo, ne posnetek zaslona iz skupinskega klepeta.

Kaj potrebuje asistent

  • Tri zamrznjene zanke: (1) majhen interaktivni uporabniški vmesnik za spletni razvoj, (2) refaktoriranje več datotek s testi, (3) dolga seja v slogu agenta z orodji/koraki lupine
  • List z rezultati: Naloga / Nastavitev napora / Žetoni / Stenska ura / Čist tek? / Združeno? / Opombe
  • Osnovne opombe iz prejšnjega privzetega modela na istih treh hlačah (celo grobo)
  • Proračunsko pravilo: največji napor le, kadar je neuspeh drag; cenejše privzeto pravilo za obsežna opravila
  • Povezave ali posnetki zaslona javnih tabel z oznako »samo termometer«, ne pa merila za sprejem
  • Človeški lastnik, ki se odloči o privzetih nastavitvah po končani peki - ne po prvi lepi predstavitvi localhost

Primer navodila

Pomagaš mi opraviti pošten tridelni preizkus za Claude Opus 5.5, preden spremenim privzete nastavitve kodiranja. Uporabljaj samo opise nalog in številke uporabe, ki jih prilepim. Ne izmišljuj si Arena Elo, rezultatov indeksa agentov ali odstotkov stroškov.

Naloga: Sestavi mojo tabelo z rezultati, napolnjeno z nadomestnimi besedili za tri opise. Nato napiši pravilo odločanja s šestimi točkami: kdaj naj Opus 5.5 ostane privzet, kdaj naj se največji/največji napor rezervira samo za lepljive zahteve in kdaj naj se za količinsko delo uporabi cenejši model. Če se v mojem prilepljenem zapisku pojavi številka javne lestvice, jo označi kot TERMOMETER.

Omejitve: britanska angleščina. Prepovedati jezik »najboljša koda umetne inteligence za vedno«. Dati prednost stroškom na združeno spremembo pred občutkom. Če manjka metrika, namesto ugibanja trditev o razredu Fable ali 40 % napisati [POTREBUJEMO MERJENJE].

Izhod: glava tabele in tri prazne vrstice, poimenovane po mojih nalogah, nato pa oznake odločitev. Brez uvoda.

Kako ga preizkusiti

  • Zaženite opis uporabniškega vmesnika in prenovo z enakimi nastavitvami napora, ki jih uporabljate vsak dan. Prepričajte se, da ste zabeležili žetone in stensko uro, ne le »izgledalo je dobro«
  • Vprašajte se: »Ali je Code Arena št. 1 sama po sebi upravičila preusmeritev proizvodnje?« Dober odgovor: ne – to upravičujejo le rezultati peke.
  • Robni primer: uporabniški vmesnik se pokvari, dolga seja agenta porabi žetone in še vedno potrebuje človeka - potrdite, da je Max rezerviran in ne nastavljen kot privzeti za delo z lepilom.
  • Robni primer: najtežja patološka zahteva še vedno ne uspe - potrdite, da ohranjate drugi model topel in ne prepisujete celotnega sklada.
  • Preverjanje sprejemljivosti: (1) ni izmišljenih 1.818 ali 66 kot izmerjena ocena, (2) tri naloge so bile opravljene ali izrecno neuspešne z opombami, (3) zabeleženi stroški, (4) cenejša privzeta vrednost je še vedno poimenovana po količini, (5) datum ponovnega pregleda je določen za nekaj izdajnih ciklov pozneje.

Rezultat

Ilustrativni rezultat (primer ocene za enega samostojnega razvijalca na treh zamrznjenih nalogah v enem popoldnevu, ne pa neodvisnega ponovnega zagona Arena.ai ali umetne analize): Na nalogi za uporabniški vmesnik v slogu WebDev je Opus 5.5 pri običajnem naporu v enem prehodu ustvaril čist predogled lokalnega gostitelja (1 od 1 je bil združen po rahlem dodelanju; približno 12 minut stenskega testiranja). Pri refaktoriranju več datotek je 1 od 1 testnega paketa postal zelen po enem vodenem ponovnem poskusu; žetoni so bili približno 30 % višji od prejšnje privzete vrednosti na isti nalogi (izvoz samoocenjene uporabe). V dolgi seji agenta se je lepljiva zahteva dokončala s človeško pomočjo po skoku žetonov - močna pri večjem naporu, preveč draga kot vsakodnevna privzeta vrednost. Odločitev po peki: Opus 5.5 je postal privzeta za refaktoriranje uporabniškega vmesnika in srednje velikih sistemov; največji napor je rezerviran za neprimerne zahteve; cenejši model je ohranjen za opravila README/lepljenje. Na kontrolnem seznamu za higieno (oznake termometra ohranjene, žetoni zabeleženi, drugi model topel, brez zamenjave »najboljši za vedno«) so bile 4 od 4 postavk uspešno opravljene. Omejitve: n=3 naloge, en razvijalec, pristranskost pri izbiri v korist zmag v uporabniškem vmesniku, ki jih je mogoče deliti; vrzeli v javnih Elo testih se lahko spremenijo naslednji teden.

Če želite izmeriti svojo različico: zamrznite iste tri povzetke; najprej ocenite svoje trenutne privzete vrednosti; zaženite Opus 5.5 z enakimi povzetki; primerjajte uspeh, žetone, stensko uro in stopnjo združevanja; nato nastavite stopnje napora z prikazanimi imenovalci.

Kaj lahko gre narobe

  • Čaščenje posnetkov zaslona: Samo preklop privzetih nastavitev uvrstitve Code Arena.
  • Max-for-everything: Poraba žetonov za kodo lepila, ker je bila zgornja meja rezultata videti lepa.
  • Demo pristranskost: Razpoloženje, pridobljeno s scenarijem, je uspešno, medtem ko vstopnica za monorepozitorij še vedno ne uspe.
  • Stroškovna slepota: Ignoriranje opomb o stroških na nalogo na vrhovih indeksa agentov.
  • Zaklepanje enega modela: Oddaja toplega rezervnega igralca, ko so konkurenčni modeli Max v dosegu roke.
  • Večno razmišljanje: Preskočim ponovni obisk po naslednjem gnečem tednu lansiranja.

Praktični nasvet

Opus 5.5, ki vodi v Code Arena WebDev in indeksu kodnih agentov, je pravi signal za porast - in še vedno le termometer. Zaženite eno gradnjo uporabniškega vmesnika, eno refaktoriranje več datotek in eno dolgo sejo agenta; beležite žetone in združitve; rezervirajte največji napor za lepljivo delo; ohranite cenejšo privzeto vrednost za količino. Krone se vrtijo. Vaši stroški na združeno spremembo so trofeja, ki šteje.

Pogosta vprašanja

Kaj pomeni, da se je Claude Opus 5.5 pravkar uvrstil na 1. mesto na Code Areni?

Arena.ai je Claude Opus 5.5 (Max) uvrstil na vrh lestvice spletnih razvijalcev na Code Areni s 1818 točkami – približno šestindvajset pred GPT-6 Astra Max v poročanju in precejšen skok v primerjavi s prejšnjim Opusom 5 Max, ki je dosegel skoraj 1692 točk. Artificial Analysis pa na ločeni lestvici prav tako uvršča Opus 5.5 na prvo mesto na svojem indeksu kodirnih agentov, vključno z 66 točkami pri maksimalnem rezultatu v Claude Code. To so podatki, ki jih je objavila uprava, ne pa neodvisna laboratorijska revizija. Zgodba je, da se kodirne plošče hitro menjajo, ne le da gre za objavo na začetku.

Kako velik je preskok z Opus 5 Max na Opus 5.5 Max na Code Areni?

Na objavljenem posnetku WebDeva je prejšnji Claude Opus 5 Max dosegel blizu 1.692, Opus 5.5 (Max) pa 1.818 kot nedvomno najboljši vstop. To je približno 126 točk več kot pri isti družini Max – vrsta delte, zaradi katere ljudje osvežujejo lestvice Elo, kot so športni rezultati. GPT-6 Astra Max je predstavljen kot tesno drugi z razliko približno 26 točk. Tabelo berite kot termometer moči preferenc, ne pa kot sodbo o vašem produkcijskem zaostanku.

Kaj v praksi meri WebDev pas na Code Areni?

Code Arena WebDev temelji na primerjalnih preferencah pri nalogah kodiranja in gradnje vmesnikov: volivci izbirajo zmagovalce med rezultati modelov. To nagrajuje kodo, ki je videti pravilno, se v demonstracijah izvaja čisto in se zdi dodelana – struktura frontenda, interaktivnost in vizualna skladnost. Gre za drugačen šport kot statični izpit z več možnimi odgovori ali dolgoročno evalvacijo agenta, ki mora ohranjati lupino živo za številne klice orodij. Prednost 1818 WebDev je prednost preference pri teh gradnjah, ne pa celoten prehranski panel za vsak repozitorij.

Kakšen je rezultat indeksa kodirnega agenta umetne analize za Opus 5.5?

Artificial Analysis poroča, da je Opus 5.5 novi številka ena na svojem indeksu kodnih agentov, z izboljšavami v vseh spremljanih evalvacijah. Pri maksimalnem naporu znotraj Claude Code je model dosegel 66 točk - najvišjo oceno, ki so jo doslej izmerili. Opomba za odrasle je, da se stroški na nalogo povečajo, ko pritisnete na plin. Najvišji rezultat agenta je trditev o zmogljivosti; stroški na nalogo so trditev o operacijah in to nista ista žival.

Je Claude Opus 5.5 najboljša koderska umetna inteligenca za vsakdanje delo?

Odvisno je, kaj za vas pomeni »najboljše«: Elo na javni areni, indeksiranje agentov z maksimalnim naporom, stroški na končano nalogo ali ali se vaše zapleteno repozitorij prevede v petek zvečer. Dnevi v obliki spletnega razvoja – ciljne strani, prototipi, vizualno poliranje – se dobro ujemajo z vodstvom spletnega razvoja na Code Areni. Dnevi agentov v zapletenih kodnih bazah naredijo indeks kodirnih agentov bolj zanimiv, pri čemer je še vedno prisoten opozorilo glede stroškov. Krožijo zapiski, ki pravijo, da lahko še vedno zaostaja pri najtežjih nalogah in kuri žetone v dolgih sejah.

Kako naj se ekipe spopadejo s kompromisom med stroški in konicami pri Opus 5.5?

Največji napor rezervirajte za delo z več datotekami, kjer so napake drage, in zmanjšajte napor za rutinsko lepljivo kodo, refaktoriranje in poliranje, ki zahtevajo veliko truda. Spremljajte svoj lastni CPA (strošek na združene dele), ne le javnega ELO. Model, ki zmaga z največjim naporom, lahko še vedno izgubi teden, če vsaka naloga porabi bogastvo v žetonih. Samostojni indie hekerji in podjetja, ki spremljajo ekonomijo enot, lahko kričijo o istem posnetku zaslona, ​​medtem ko potrebujejo različne privzete nastavitve.

Katere trditve o izdelkih v obtoku obkrožajo klepet o Claude Opus 5.5 Just Ranked #1?

V medijih krožijo trditve o približno enakovredni zmogljivosti razreda »Fable 5.1« pri številnih nalogah, pri približno 40 % nižjih stroških delovanja ter močnejšem agentskem kodiranju in vedenju pri uporabi računalnika kot pri prejšnjih različicah Opusa. Nekateri uporabniki pravijo, da še vedno zaostaja pri najtežjih nalogah in da lahko dolge seje porabijo žetone bolj, kot ljudje pričakujejo. To obravnavajte kot trditve o kroženju, ne pa kot preverjene laboratorijske rezultate iz članka. Osebna delovna obremenitev premaga trženjsko sosedstvo, ko prispe račun.

Zakaj se je ta teden odziv razvijalcev čez noč zdel tako glasen?

Razvijalci objavljajo hitre aplikacije z lokalnim gostovanjem, drobne igre, snemalne knjige in gradnje uporabniških vmesnikov, ki so videti kot vikend projekti iz prejšnjega četrtletja – z izbiro zmagovalcev. Šale z napisom »Prosim, ne oslabite sistema« so preizkus temperature sentimenta, ko se model v naravi zdi skoraj preveč dober. Platforme, kot je Questflow, so bile v pogovoru o nadgradnji z Opusa 5 na 5.5, kar kaže na oprijemljivo povpraševanje. Anekdotske predstavitve so reakcija, ne nadzorovane revizije – to razlikovanje naj bo jasno.

Kaj naj gradbeniki storijo, ko vidijo kodirne plošče Opus 5.5?

Izvedite lastno preizkusno delo s tremi nalogami: eno gradnjo uporabniškega vmesnika, eno večdatotečno refaktoriranje in eno dolgo sejo agenta. Beležite žetone in stensko uro, ne le »ali je delovalo«. Z Arena.ai in Artificial Analysis ravnajte kot z javnimi termometri, za obsežna opravila ohranite cenejšo privzeto nastavitev in opazujte, kako platforme, ki so že na različici 5.5, spreminjajo obstoječe poteke dela, preden vse prepišete. Ignorirajte poskuse »najboljše za vedno« in se po nekaj ciklih izdaj ponovno posvetujte – krone se vrtijo; zmogljivosti se stopnjujejo.

Kako izvedem pošten tridelni preizkus programiranja, preden spremenim privzete nastavitve kodiranja?

Zamrznite tri povzetke – majhen interaktivni uporabniški vmesnik za spletni razvoj, večdatotečno refaktoriranje s testi in dolgo sejo v slogu agenta – nato ocenite nalogo, napor, žetone, stensko uro, čisto delovanje?, združeno? in opombe. Primerjajte s prejšnjimi privzetimi vrednostmi za iste povzetke; največji napor uporabite le, če je neuspeh drag. Javne številke plošč označite kot termometre, ne kot merila sprejemljivosti. Privzeto vrednost določite po preizkusu, ne po prvi lepi predstavitvi localhost – in cenejši model ohranite na toplem za obsežno delo.

Reference

  1. Antropično — antropično.com
  2. Claude Platform — platform.claude.com
  3. Arena.ai — Koda Arena — arena.ai
  4. Umetna analiza — indeks kodirnega agenta — artificialanalysis.ai
Kviz
1. Kaj članek poroča o Claude Opus 5.5 (Max) na Arena.ai Code Arena WebDev?

2. Katera izstopajoča številka je na indeksu kodirajočih agentov Artificial Analysis povezana z maksimalnim naporom?

3. Kdaj naj bi gradbeniki rezervirali Opus z največjim naporom, glede na ključne ugotovitve?

4. Katero peko priporoča članek, preden zamenjate privzeti model?

5. Zakaj članek pravi, da je »najboljša kodna umetna inteligenca« začasna za vsakodnevne ekipe?


Nazaj na blog