CLM-8B

CLM-8B pravkar izdan: nov model odprte umetne inteligence, ki naj bi bil do 9× hitrejši od Jev za agente

Kratek odgovor: CLM-8B je odprt kontrastivni jezikovni model , namenjen hitrim odločitvam agentov, pri čemer avtorji trdijo, da je latenca do približno 9-krat nižja kot pri modelih razreda Jev. Te številke ostajajo nepotrjene zunaj izdaje. Če gradite kodne agente, jih najprej preizkusite na svojem lastnem sistemu, preden zaupate grafikonom.

Ključne ugotovitve:

Trditve o zakasnitvi: Pospešek ~9× Jev obravnavajte kot pospešek, ki ga je navedel avtor, dokler ga drugi ne reproducirajo.

Eval pas: Orodja in pozivi so fiksni med A/B testiranjem CLM-8B.

Hibridni sklad: Za vroče zanke uporabite CLM; za nove naloge uporabite počasnejši modul za sklepanje.

Odprte teže: Pred pošiljanjem komercialnih vilic preverite licenčne datoteke Apache.

Tveganje zlorabe: Orodja in skrivnosti, ki se lahko reverzibilno uporabijo, so dostopna, ko se agenti odločijo v milisekundah.

Kaj poskuša biti CLM-8B ⚡

Usposabljanje kontrastivnega jezikovnega modela, kot ga opisujejo ljudje, ki promovirajo ta drop, gre za povezovanje stanj in dejanj, ne pa za maksimiranje verjetnosti naslednjega žetona v izolaciji. Povedano jedrnato: model je spodbuden, da preslika »tukaj je situacija« v »tukaj je poteza«, bolj kot politik kot romanopisec. To je analogija Sistema 1, h kateri raziskovalci vedno znova iščejo – hitra, asociativna, v obliki odločitve – v nasprotju s slogom Sistema 2, ki temelji na dolgi verigi misli, ki kuri žetone, medtem ko razmišlja na glas.

CLM-8B je prvi javni nabor uteži v tej liniji. Postavljen je kot odprta raziskovalna izdaja z licenco Apache 2.0 na poročanju, ki je spremljalo objavo, kar je pomembno, če želite natančno določiti, poslati ali razvejati brez odvetniškega piknika. Jacky Kwok je predstavil delo; Azalia Mirhoseini, ki je povezana s Stanfordom, ga je dopolnila; širši okvir pa prikazuje Stanfordom in NVIDIA. Imenovani raziskovalci, javne uteži, odprta koda – ne anonimno puščanje informacij. Za replikacijo s strani tretjih oseb je še zgodaj, zato naj bo skepticizem nekje med »zanimivo« in »pokažite mi neodvisni odbor«.

Velikostni razred je osem milijard parametrov, kar je dovolj majhno, da ga lahko laboratoriji in neodvisni razvijalci gostijo, ne da bi za H100 prodali ledvičko. Že se govori o večjem CLM-35B . Ali bo ta večji brat ohranil zgodbo o zakasnitvi ali bo hitrost zamenjal za globino, ostaja nejasno, vendar je signal načta jasen: to naj bi bila družina, ne enkratna demo kartica.

  •  Fokus: stanje → akcijske zanke za agente, ne pisanje esejev
  •  Licenciranje, uokvirjeno kot Apache 2.0 v poročilu o izdaji
  •  Slog: Sistem 1 / zgodba o usposabljanju, usmerjenem k odločitvam
  •  Nadaljevanje: večji CLM-35B omenjen kot načrt

Sistem 1 Style v primerjavi z običajnim tekalnim trakom na žetone 

Večina produkcijskih LLM-jev, ki jih poznate, generira besedilo po en žeton naenkrat. To odlično deluje za prozo, izpise kode in skrbne sledi sklepanja. Zato se lahko agent, ki potrebuje dvajset mikroodločitev na minuto, zdi počasen, tudi če je model "pameten". Vsak korak plača avtoregresivni davek.

Kontrastivni jezikovni model obrne poudarek. Namesto da bi omrežje prosil, naj se s pripovedovanjem prebije do odgovora, ga naučite, da glede na stanje daje prednost pravilnemu dejanju – pomislite na kontrastivna vlečenja med dobrimi in slabimi potezami, ne le na tekoča nadaljevanja. Graditelji že poznajo vzorec: včasih ne potrebujete tisočbesedne utemeljitve; potrebujete model, ki namesto rm -rf vnese pytest . Hitre zanke upoštevajo to razlikovanje.

Nič od tega ne pomeni, da CLM-8B ne more oddajati besedila. Pomeni, da sta cilj usposabljanja in zgodba o vrednotenju nagnjena k agentnemu nadzoru. To je drugačna oblika izdelka kot "model klepeta, ki lahko tudi kliče orodja". Industrija je leta izboljševala modele za govorjenje o orodjih, hkrati pa je še vedno omejovala sam govor. Model, ki se najprej odloči, je vrsta stranskega gibanja, ki je bodisi videti očitno za nazaj bodisi propade, ko se merila prepletajo. Oba izida sta možna.

Navedena hitrost in številke s klopi (obravnavaj kot trditve)

Tukaj je del, ki spodbuja objave na družbenih omrežjih: promotorji trdijo, da je sklepanje do približno 9-krat hitrejše kot pri modelih razreda Jev. Po rahli natančnejši nastavitvi poročajo tudi o dobrih rezultatih agentnega kodiranja - DeepSWE približno 81,6 % uspešnosti in Terminal-Bench 2.1 približno 87,6 %. V nekaterih evalvacijah opisujejo zmogljivost z ničelnim kodiranjem kot primerljivo z Jev, medtem ko latenca ostaja precej nižja. En povzetek gruče, ki je bil vključen v pogovore o izdaji, je navedel približno 32 ms odzivnih časov v razredu na nastavitvi terminalskega preizkusa. To previdno frazeologijo navedite: poročano in zahtevano, v tem članku ni bilo neodvisno revidirano.

Če te številke zakasnitve posplošimo, je praktična zmaga manj grafičnih procesorjev na sočasnega agenta oziroma več agentov na grafični procesor. Agenti za programiranje, ki preizkušajo lupino, so še posebej občutljivi, ker se čakanje na stenski uri kopiči; odločitev s 200 ms in odločitev s 30 ms se po nekaj sto potezah zdita kot različna izdelka. Uporabniki pogosto krivijo "neumnost modela", ko je hujša težava interaktivni zamik.

Kljub temu – in to je odstavek o nadzoru odraslih – se avtorjevi programi tržijo, dokler jih nekdo drug ne reproducira na skupni strojni opremi z skupnimi pozivi. Rezultati lahkega natančnega nastavljanja lahko skrijejo tudi veliko odra. Močne številke DeepSWE in Terminal-Bench so vznemirljive ravno zato, ker ti paketi kaznujejo krhke agente, vendar navdušenje ni replikacija. Imejte samolepilni listek z napisom CLAIM na 9× in na tej številki razreda 32 ms. 

Primerjalna tabela: LLM-ji po žetonih v primerjavi z okvirjanjem v slogu CLM

Tabele pomagajo, ko postane marketinški jezik spolzek. Ta primerja tipične navade ustvarjanja LLM z zgodbo o modelu kontrastivnega jezika, kot jo opisujejo raziskovalci. Celice so namerno nekoliko neenakomerne, ker so konkretne primerjave vedno neenakomerne.

Kot Tipični LLM (žeton za žetonom) Okvirjanje v slogu CLM / Sistem 1 Zakaj je to pomembno za agente
Primarna zanka Predvidi naslednji žeton, pogosto z dolgimi sledmi Preslikava stanja v dejanje; kontrastivna pristranskost odločanja Manj zapravljenih žetonov med klici orodij (v teoriji)
Občutek zakasnitve Pod večstopenjskim nadzorom se lahko počuti počasnega in zgovornega Avtorji trdijo, da je latenca veliko nižja v primerjavi z Jev-razredom Interaktivni kodirni agenti sovražijo čas čakanja
Območje moči Proza, načrtovalni eseji, širok klepet Hitro stanje→akcija - poudarjeno agentno kodiranje Drugačno delo, ne vedno zamenjava
Poročane številke Odvisno od modela; tukaj ni ene same številke Do ~9× hitrejši (zahteva); DeepSWE ~81,6 %; Terminal-Bench 2.1 ~87,6 % po lahkem FT (zahteva) Obetavno, če tretje osebe potrdijo - veliko, če
Odprtost Mešanica zaprtih API-jev in odprtih uteži Odprte uteži/koda, uokvirjena v Apache 2.0 Izpopolnite in gostite se brez ugibanja pogojev
Ulov / posebnost Pameten, ampak včasih pripoveduje v nedogled 🐢 Še zgodaj; neodvisne ponovitve čakajo Ne stavite podjetja na en sam tiskovni grafikon

Tabelo uporabite kot miselni model, ne kot razsodbo. Produktne ekipe morajo še vedno izmeriti lastno opremo: sheme orodij, politika ponovnega poskusa in hrup okolja bodo vplivali na rezultate bolj, kot to dopušča diapozitiv.

Kdo stoji za hrupom 👤

Pripisovanje je pomembno, saj odprte objave umetne inteligence segajo od previdnih laboratorijskih izdaj do skrivnostnih torrentov. Ta ima obraze. Jacky Kwok je predstavil CLM; Azalia Mirhoseini je pomagala, da je bil predstavljen širši javnosti; poročanje dosledno uokvirja raziskovalno sodelovanje, povezano s Stanfordom in NVIDIA. To sicer ne pomeni, da so vse številke čarobno resnične, vendar pa v igro vnaša ugled. Odprte objave imenovanih raziskovalcev so običajno hitreje podvržene stresnemu testu kot anonimne objave – vrstniki imajo radi javno tarčo.

Za razvijalce je praktična posledica dostop. Odprte uteži in licenca v slogu Apache 2.0 (kot je bilo obravnavano ob lansiranju) običajno pomenijo, da lahko komercialno eksperimentirate z manj težavami kot licence, namenjene samo raziskavam. Preden karkoli pošljete, sami preverite dejanske licenčne datoteke v izdaji; povzetki kritja niso pogodba. To se morda sliši pedantno, vendar pedantnost pri licenciranju rešuje zagonska podjetja.

Vzorec družbene amplifikacije je znan: objava raziskovalca, citatne objave spoštovanih ojačevalcev, nato val poskusov »agenti končno rešeni«. Filtrirajte po ljudeh, ki delijo podrobnosti o orodju. Posnetki zaslona enega samega uspešnega kodiranja so gledališče razpoloženja, ne znanost. 🛰️

Zakaj zanke od stanja do dejanja lastno kodiranje agentov 

Agentsko kodiranje je kruto okolje. Model vidi posnetek repozitorija, prepis lupine, morda neuspešen test in mora izbrati urejanje ali ukaz. Uspeh je pogosteje binaren kot klepet. Ali test postane zelen ali pa ne. Ta oblika nagrade daje prednost politikam, ki jasno izbirajo dejanja, pred modeli, ki pišejo lepe eseje o neuspehu.

Kontrastivne zgodbe o učenju ustrezajo temu svetu, ker eksplicitno spodbujajo omrežje k prednostnim dejanjem v danem stanju. Predstavljajte si to kot učenje mlajšega inženirja "ko vidiš ta razred napak, poseži po tem vzorcu popravkov" namesto "napiši objavo na blogu o tem, zakaj so prevajalniki težki". Mlajši inženir še vedno potrebuje presojo; bližnjica le zmanjša tresenje.

Zakasnitev se tukaj stopnjuje. Recimo, da agent v povprečju opravi osemdeset korakov orodja, da doseže srednje velik popravek napake. Zmanjšajte čas za 150 ms na korak in povrnete dvanajst sekund stenske ure – kar je razlika med stanjem pretoka in uporabnikom, ki se s tipko Alt Tab odmakne za preverjanje e-pošte. Ekipe, ki upravljajo flote agentov, to matematiko občutijo tudi pri računih za oblak. Domnevna pospešitev sklepanja za velikostni red v primerjavi z vrstnikom razreda Jev, tudi če v praksi doseže "le" 4×, še vedno prerazporedi načrtovanje zmogljivosti.

Na sestankih nenehno uporabljam majavo metaforo: modeli klepeta žeton za žetonom so kot razprava o poti na vsakem križišču, medtem ko je krmilnik v slogu Sistema 1 bolj podoben mišičnemu spominu za vožnjo po mestu. Mišični spomin odpove v novem mestu. Enako velja za ozko nastavljen akcijski model, ko je kultura repozitorija idiosinkratična. Še vedno želite deliberativne načine za nove arhitekturne izbire; želite reflekse za petdeseti "popravi uvoz in ponovno zaženi". Hibridni skladi - hiter krmilnik, podoben CLM, in težji sistem za sklepanje na trdih vejah - so verjetno tista, kjer pristanejo resni sistemi, tudi če predstavitve prodajajo en sam model junaka. 🚦

Prav tako je vredno na glas povedati: agentsko kodiranje, kot sta DeepSWE in Terminal-Bench, nagrajuje oder. Kakovost izkoriščanja, seznami dovoljenih orodij in pozivi za obnovitev lahko stopnjo uspešnosti dvignejo za dvomestno številko. Ko po lahki natančni nastavitvi vidite ~81,6 % ali ~87,6 %, poglejte, kakšen ovoj je bil okoli uteži. To ni senca; tako deluje polje.

Odprte uteži, fino nastavljanje in senca 35B 

Odprte uteži spremenijo družbeno dinamiko zahtevka. Zaprti modeli API-jev lahko pokažejo grafikon in vas pustijo ugibati o kontaminaciji, trikih dekodiranja ali skrivnih sistemskih pozivih. S prenosljivimi parametri lahko vsaj malo pobrskate po stvareh. Natančna nastavitev CLM-8B za vaše notranje kodno okolje – vaša pravila lint, vaš CLI za uvajanje, vašo topologijo monorepozitorija – je realistična pot do bleščečih rezultatov na klopi, ne pa čarovnija ničelnega poskusa že prvi dan.

Uokvirjanje Apache 2.0 (glede na poročilo) je prijazno za razvijalce: jezik podeljevanja patentov, jasne norme za prerazporeditev, manj pasti "samo za raziskave". Še enkrat: preberite datoteke. Pisci poročil povzemajo; odvetniki so specializirani.

Načrtovani CLM-35B je slon na zdrsu iz načrta. Večji modeli pogosto ponovno pridobijo premišljene sposobnosti in izgubijo nekaj šarma "drobnih in neverjetno hitrih", razen če destilacija ali špekulativni triki ne nadzorujejo zakasnitve. Če je osemmilijardna različica športni avtomobil, petintridesetmilijardna pa potovalna limuzina, bi ekipe lahko obdržale oba: 8B za vroče zanke, 35B za zahtevno načrtovanje. Ali pa bi večji model preprosto prevladal, če bi se strojna oprema še naprej cenejšala. Katera prihodnost bo nastopila, še ni znano; odločile bodo opombe o izdaji prihodnosti, ne ta odstavek.

Pri modelih odprtih agentov obstaja subtilno tveganje: ljudje jih bodo vgradili v neomejeno količino brez omejitev hitrosti in odkrili takojšnje vbrizgavanje prek zlonamernih datotek README. Hitri modeli krepijo zlorabo na enak način, kot krepijo praktično vrednost. Zaščitne ograje niso neobvezna preobrazba; so izdelek. 

  • Pred presojo kakovosti natančno nastavite svoje sledi
  • Za nove naloge si kot izhod v sili pomagajte z počasnejšim razmišljanjem
  • Latenca instrumenta p50/p95 v vašem pasu, ne le natančnost
  • Predpostavimo, da bo 35B ponovno premaknil Pareto mejo

Branje primerjave z Jevom, ne da bi vas zasnežil sneg 

Primerjave z modeli razreda Jev opravljajo retorično delo. Vzpostavljajo enakovredne modele na ravni agentske hitrosti, tako da ima "do 9× hitrejši" referenco. Relativne trditve potrebujejo sidro in to je smiselno. Nevarnost je, da se celoten sklad ocenjevanja zruši v en sam množitelj. Velikost paketa, natančnost, nastavitve dekodiranja, dolžina konteksta in serializacija klicev orodij spreminjajo pomen "hitrejšega", ti gumbi pa se redko pojavijo na istem diapozitivu.

Ko povzetek gruče navaja ~32 odgovorov v razredu ms na terminalski preskusni napravi, obravnavajte »odziv« kot dvoumno oznako, dokler nekdo ne pojasni, ali pomeni prvi žeton, JSON s polnim dejanjem ali predpomnjeno predpono. Te razlike spremenijo marketinške milisekunde v inženirske ure. Primerljiva kakovost z ničelnim rezultatom in nižjo zakasnitvijo je sanjski par; če neodvisne skupine potrdijo vsaj polovico teh sanj, si usposabljanje v slogu CLM prisluži stalno mesto na arhitekturnih srečanjih.

Do takrat pa Jeva obravnavajte bolj kot zgodbo o rivalstvu kot pa kot ustaljeno lestvico najboljših. Rivalstva prodajajo objave. Vaši KPI-ji za produktivnost se ne menijo za zgodbo. Merite uspeh naloge, dolar na rešeno zahtevo in stopnjo človeškega posredovanja. Če zmaga razcep kontrastivnega jezikovnega modela, praznujte. Če zmaga samo na Twitterju, nadaljujte. 🚶

Čas za manjše protislovje: rivalske zgodbe še vedno imajo svojo težo. Laboratorije silijo k objavljanju številk namesto lahkomiselnega razpoloženja. Le ne zamenjujte lestvice rezultatov s športom.

Kaj mora ta izdaja narediti pravilno 

Da bi bil CLM-8B pomemben tudi zunaj okvira novičarskega cikla, se mora zgoditi nekaj stvari:

  • Replikacija: zunanje skupine bi morale biti sposobne primerjati zakasnitev naslovov in stopnje uspešnosti kodiranja z dokumentiranimi recepti.
  • Izkoristite preglednost: delite podrobnosti ovojnice agenta, ki so ustvarile ocene DeepSWE in Terminal-Bench.
  • Dokumenti, ki ne predpostavljajo laboratorijske telepatije: jasni skripti za natančno nastavitev, ukazi eval in opombe o strojni opremi.
  • Načini napak: pokažite, kje se odločitve v slogu Sistema 1 sesujejo – novi API-ji, dvoumne zahteve, varnostno občutljive operacije.
  • Pot nadgradnje: pojasnite, kako je CLM-35B povezan, da ekipe ne bi preobremenile svojega sklada do slepe ulice z 8B.

Če ta polja ostanejo prazna, model postane še en zanimiv pritisk za papir. Če se zapolnijo, imajo agentske platforme na voljo konkretno izbiro komponent: deliberativni LLM za trdo razmišljanje, kontrastivni hitri model za trzajoče roke. Takšna delitev dela se zdi bolj odrasla kot pretvarjanje, da bi moral en megamodel opraviti vsako delo pri vsakem proračunu zakasnitve.

Praktični nasveti za gradbenike, ki delajo kot posredniki pri pošiljanju 

Ni vam treba jutri prepisati svojega sklada. Potrebujete pa načrt za ocenjevanje modelov hitrega odločanja. Začnite z določitvijo dela agenta, ki je kritičen glede zakasnitve – morda mikrozanko terminala ali korak »izberi naslednji grep« – in nato A/B natančno nastavite CLM-8B glede na vašo trenutno delovno silo. Ohranite konstanten pas. Vse beležite.

Pazite na tihe regresije kakovosti: modeli, ki se takoj odzovejo z samozavestnimi napačnimi dejanji, so v repozitorijih z visokimi vložki slabši od počasnih pravilnih. Dodajte korake preverjanja. Dajte prednost reverzibilnim orodjem. Predvidite drugi klic modela, ko je zaupanje nizko – da, to požre del hitrostne zmage in to je v redu. Hitrost brez zavor je način, kako predstavitve postanejo izpadi.

Na strani organizacije posodobite preglednice zmogljivosti s stolpcem za »dejanja na sekundo na GPU« namesto samo za žetone na sekundo. Agentske delovne obremenitve so pomembne za odločitve, ne za prepustnost poezije. Če avtorjeva trditev ~9× vsaj delno preživi stik z vašo strojno opremo, bo vaša preglednica videti drugače. Če ne, ste se poceni naučili.

In prosim, zaradi ljubezni do operacij, ne prilepite produkcijskih skrivnosti v eksperimentalni agent, ker se je model zdel "varen". Hitro odprti modeli olajšajo zagon senčnih sistemov, ki jih nihče ne pregleduje. Proces je še vedno pomemben. 

Odprte teme še vedno visijo 

Nekaj ​​nerešenih tem me odvrača od popolnega promocijskega načina:

  • Kolikšen delež poročanega uspeha kodiranja pripada utežem v primerjavi s podatki za natančno nastavitev in ovojem, ostaja nejasno.
  • Okvirjanje Sistema 1 se lahko razredči, kadar naloge zahtevajo dolgoročno načrtovanje in ne lokalnih refleksov lupine.
  • CLM-35B lahko ohrani zgodbo o zakasnitvi ali pa se ustali kot še en močan srednje velik LLM.
  • Nastavitve kontrastnih dejanj lahko postanejo krhke pri spremembi distribucije – novi jeziki, novi oblačni CLI-ji, kontradiktorna skladišča.
  • Zgodba o varnosti še vedno potrebuje konkreten kontekst, saj se dejanja izvajajo v milisekundah.

To niso triki, namenjeni temu, da bi se ekipa znebila odgovornosti. To so preverjanja, ki jih mora opraviti vsak resen pregled uvedbe. Zgodnje odprte izdaje si zaslužijo pozoren pregled in trenje, ne pa slepih namestitev.

Bistvo 

CLM-8B je odprt, na Apacheju zasnovan (na podlagi pokritosti) kontrastivni jezikovni model, namenjen hitremu pretvarjanju stanja v dejanja agentov. Javnosti ga je predstavil Jacky Kwok z razširitvijo Azalije Mirhoseini in je predstavljen kot raziskava, povezana s Stanfordom/NVIDIA. Naslovne trditve – do približno 9× hitrejše od sklepanja razreda Jev, močni rezultati DeepSWE in Terminal-Bench po lahkem natančnem nastavljanju, primerljiva kakovost ničelnega odziva z veliko nižjo zakasnitvijo, vključno s klepetom o odzivih terminalov razreda ~32 ms – so poročali avtorji in še vedno čakajo na širšo potrditev tretjih oseb. Na obzorju je večji CLM-35B.

Če gradite agentske kodne sisteme, je to vredno osredotočene ocene, ne religije. Obravnavajte ga kot kandidata za krmilnik Sistema 1 v hibridnem skladu, izmerite svojo zmogljivost in imejte nalepko CLAIM na vsakem grafikonu, dokler ne pridejo neodvisni izidi. Zanimiv del ni še en model klepeta z novim logotipom. Zanimivo je, ali lahko učenje, ki ga oblikujejo odločitve, agentom da občutek takojšnjega delovanja, ne da bi jih to pripeljalo do nepremišljenih napak.

Praktični primer: Izdelava mikrozanke eval agenta s kritično zakasnitvijo za CLM-8B

Avtorjeve tabele o pravkar predstavljenem CLM-8B: Nov odprti model umetne inteligence, ki trdi, da je za agente do 9-krat hitrejši od Jeva, se lahko zdijo prepričljive; vaš pas je edini glas, ki šteje. Takole je britanska neodvisna ekipa za orodjarstvo obravnavala CLM-8B kot kandidata za krmilnik System 1 – ne kot zamenjavo za klepet – in ga izmerila na lastni terminalski mikrozanki.

Scenarij

Sam vodi majhen izdelek, ki že uporablja zahtevnejšega kodirnega agenta za refaktoriranje več datotek. Težaven del je vroča zanka: prebere neuspešen prepis testa, izbere naslednjo lupino ali dejanje urejanja, ga zažene, ponovi. Uporabniki se manj pritožujejo nad dolgočasnimi odgovori kot nad zamikom, ki je podoben zimskim rokavicam, po petdesetih korakih orodja. Objave na družbenih omrežjih krepijo uteži modela kontrastivnega jezika in domnevno ~9-kratno pospešitev v primerjavi z vrstniki razreda Jev, poleg tega pa še močne številke DeepSWE / Terminal-Bench po lahkem natančnem nastavljanju. Sam noče prepisati produkcije na tiskovni grafikon.

Iz lastnega monorepozitorija so izklesali eno mikrozanko, ki je kritična glede zakasnitve: dvajset sledi popravkov hroščev. Trenutni delovni konj ostaja premišljena pot za zahteve za novo arhitekturo. CLM-8B – če je gostovan in rahlo nastavljen na svojih sledeh – lahko tekmuje le v koraku »izbira naslednjega reverzibilnega dejanja«, s počasnejšim logičnim sklepanjem kot izhodom, ko je zaupanje nizko.

Cilj je A/B, ki ohranja enake nastavitve: enaka orodja, enak seznam dovoljenih, enaka politika ponovnega poskusa. Zabeležite dejanja na sekundo, zakasnitev p50/p95, uspešnost naloge in človeške posege – nato pa se odločite, ali si odprte uteži prislužijo mesto.

Kaj potrebuje asistent

  • Dvajset anonimiziranih sledi neuspešnih testov iz resničnega dela (samo vnosi + dovoljena orodja)
  • Ovoj fiksnega agenta: shema orodja, seznam dovoljenih, največje število korakov in veja »klic počasnega sklepanja«
  • Osnovni rezultati trenutnega modela za istih dvajset nalog
  • Opombe o strojni opremi za gostitelja CLM-8B (razred grafičnega procesorja, natančnost, paketno delovanje), zato ima »hitrejše« referenco
  • Pravilo nalepke CLAIM: avtor DeepSWE / Terminal-Bench / ~9× / ~32 ms ostane označen, dokler ta pas ne reproducira nečesa
  • Človeški lastnik, ki pred kakršno koli vključitvijo celovite integracije pregleda napačna, a hitra dejanja

Primer navodila

Pomagaš mi pri oblikovanju poštenega A/B algoritma za CLM-8B kot krmilnik hitrega stanja→akcije znotraj našega kodnega agenta. Uporabi samo dejstva o omrežju, ki jih prilepim. Ne izmišljuj množiteljev zakasnitve, rezultatov DeepSWE ali licenčnih pogojev.

Naloga: Iz mojih dvajsetih imen nalog in trenutnih osnovnih zapiskov sestavite (1) list za ocenjevanje s stolpci Naloga / Model / Koraki / Stenska ura / Uspeh (uspešno/neuspešno) / Človeški poseg (d/n) / Opombe, (2) protokol s šestimi točkami, ki ohranja ovojnico enako v vseh modelih, in (3) pravilo odločanja v jasnem vsakdanjem besedilu za to, kdaj lahko CLM-8B prevzame nadzor nad mikrozanko in kdaj preidemo na počasnega sklepatelja.

Omejitve: britanska angleščina. Vsako število, ki ga je sporočil avtor, označi kot ZAHTEVEK, če se pojavi. Daj prednost orodjem za obračanje v drugo smer. Prepovej jezik »agenti so končno rešili«. Če v mojem prilepku manjka metrika, namesto ugibanja napiši [POTREBUJEM MERJENJE].

Izhod: glava ocenjevalne liste in ena izpolnjena primerna vrstica z nadomestnimi besedami, oznake protokola, nato pravilo escalation/keep. Brez uvoda.

Kako ga preizkusiti

  • Zaženite istih deset sledi na trenutnem delovnem konju in na natančnem uglaševanju CLM-8B z enakim ovojem. Potrdite, da se razlikujeta le stenska ura in uspeh - ne seznamov orodij.
  • Vprašajte: »Kateri avtorski grafikon bi lahko ta teden spremenil produkcijo?« Dober odgovor: noben, dokler ta povezava ne pokaže zmage pri skupnem uspehu in zakasnitvi.
  • Robni primer: CLM-8B odgovori v ~30 ms s predlogom za destruktivni ukaz - potrdite seznam dovoljenih in človeški pregled ga zajame pred CI.
  • Robni primer: nova API vstopnica zunaj dvajsetih sledi - potrdite, da jo ima v lasti počasni logičnik, ne pa refleksni model.
  • Preverjanje sprejemljivosti: (1) ni izmišljene trditve 9× kot izmerjen rezultat, (2) zabeležena je latenca p50 in p95, (3) imenovalec uspeha je dvajset nalog, (4) prešteta so napačno hitra dejanja, (5) preverjanje Apache/licence se izvede brez povezave pred vsakim načrtom komercialnega plovila.

Rezultat

Ilustrativni rezultat (primer ocene za eno tričlansko ekipo za orodja na dvajsetih fiksnih sledeh monorepozitorija, ne pa neodvisne laboratorijske ponovitve avtorjevih klopi): Osnovni delovni konj je brez človeške pomoči končal 14 od 20 sledi; mediana zakasnitev korakov približno 180 ms; dve sledi sta potrebovali človeka po napačnem urejanju. Po lahki natančni nastavitvi CLM-8B na notranjih sledeh (isti ovoj) je 15 od 20 opravilo brez pomoči; mediana zakasnitev korakov približno 45 ms na njihovem gostitelju z enim GPU-jem; še eno dodatno napačno hitro dejanje je pred uporabo ujel seznam dovoljenih. Čas delovanja za dvajsetsledni paket se je zmanjšal s približno 38 minut na približno 22 minut, vključno s koraki preverjanja. Na kontrolnem seznamu higiene (pas je ostal nespremenjen, oznake CLAIM so ohranjene na avtorjevih grafikonih, počasen sklepnik se je še vedno uporabljal za nove vstopnice, v eksperimentalnem agentu ni produkcijskih skrivnosti) je bilo 5 od 5 preglednih postavk opravljenih. Omejitve: majhen nabor nalog, en razred strojne opreme, prevladuje natančna nastavitev kakovosti podatkov; to ne potrjuje avtorjevih številk ~9× ali DeepSWE zunaj tega pasu.

Za merjenje lastne različice: zamrznite dvajset sledi; najprej ocenite trenutni model; gostite CLM-8B z dokumentirano natančnostjo/nastavitvami; ponovno zaženite z istim ovojem; poročajte o uspehu/n, p50/p95, intervencijah in ali je bila katera koli številka CLAIM obravnavana kot dejstvo.

Kaj lahko gre narobe

  • Čaščenje grafikonov: Dostava na ~9× diapozitivu brez lastnega p95.
  • Napačno-hitra dejanja: Takojšnje samozavestne napake premagajo počasne pravilne pri repo poslih z visokimi vložki.
  • Premik pasu: Spreminjanje pozivov orodja med modeli in označevanje tega kot zmage modela.
  • Sklad enega junaka: Opustitev premišljenega sklepanja za delo na področju nove arhitekture.
  • Ročno potrjevanje licenc: Zaupanje povzetkom kritja namesto dejanskim datotekam licenc za skladiščenje uteži.
  • Shadow CI: Vstavljanje hitro odprtega agenta v cevovode brez omejitev hitrosti ali pregleda vbrizgavanja.

Praktični nasvet

CLM-8B je vreden osredotočene ocene kot kandidat za krmilnik System 1 za agentno kodiranje - odprte uteži, zgodba, ki jo oblikujejo odločitve, avtorsko poročane hitrosti. To ni prepričanje in ni preverjen 9× za vaš sklad, dokler vaš sistem ne pravi tako. Ohranjajte ovojnico konstantno, beležite dejanja na sekundo in hitrost napačnih izhodov, ohranjajte počasnejši izhod v sili in pustite nalepko CLAIM na vsaki grafični sliki, dokler ne pridejo neodvisni izhodi (vključno z vašim).

Pogosta vprašanja

Kaj je CLM-8B in zakaj graditelji agentov govorijo o njem?

CLM-8B je prvi javni nabor uteži v liniji modelov kontrastivnega jezika – odprta raziskovalna izdaja, ki je predstavljena kot hitra zanka odločanja za agente, ne le kot še en klepetalni možgani. Zgodba o usposabljanju povezuje stanja z dejanji bolj kot refleks Sistema 1 kot počasen esej o naslednjem žetonu. Z osmimi milijardami parametrov je dovolj majhen za gostovanje številnih laboratorijev in neodvisnih razvijalcev, licenciranje Apache 2.0 pa je uokvirjeno v pokritost okoli padca. Številke v objavah o lansiranju so trditve, o katerih poročajo avtorji, ne pa neodvisne ponovitve laboratorijev.

Kako CLM-8B trdi, da je za agente do 9× hitrejši od Jeva?

Promotorji trdijo, da je sklepanje do približno 9× hitrejše kot pri modelih razreda Jev, s časom odziva približno 32 ms na terminalski preskusni napravi. Po rahli natančnejši nastavitvi poročajo tudi o dobrih rezultatih agentnega kodiranja - DeepSWE okoli 81,6 % in Terminal-Bench 2.1 okoli 87,6 % - in o kakovosti ničelnega odziva, primerljivi z Jev pri precej nižji zakasnitvi. Podatke o 9× in milisekundah obravnavajte kot trditve, dokler jih tretje osebe ne reproducirajo na skupni strojni opremi. Za relativno hitrost je še vedno treba natančno določiti velikost serije, natančnost in nastavitve dekodiranja.

V čem se učenje kontrastivnega jezikovnega modela razlikuje od tipičnih programov LLM?

Večina produkcijskih LLM-ov generira en žeton naenkrat, kar deluje za prozo in dolge sklepe, vendar obremenjuje vsako mikroodločitev, ki jo agent sprejme. Usposabljanje kontrastivnega jezikovnega modela, kot ga opisujejo promotorji, spodbuja omrežje, da preslika situacije v želene poteze – bolj kot vodja politike kot romanopisec. To uokvirjanje sistema 1 daje prednost hitrim zankam od stanja do dejanja pred večnim pripovedovanjem med klici orodij. CLM-8B lahko še vedno oddaja besedilo; zgodba o cilju in vrednotenju sta nagnjeni k agentnemu nadzoru.

Kdo je izdal CLM-8B in ali je resnično odprt?

Jacky Kwok je predstavil delo; Azalia Mirhoseini ga je razširila; poročanje uokvirja skupinsko delo, povezano s Stanfordom in NVIDIA, z imenovanimi raziskovalci, javnimi utežmi in odprto kodo. Licenciranje za izdajo je zasnovano kot Apache 2.0, kar je pomembno za natančno nastavitev in dostavo – vendar preberite licenčne datoteke v repozitoriju, preden se zanašate na povzetke poročil. Imenovane odprte izdaje so običajno hitreje podvržene stresnim preizkusom kot anonimni izpisi. Za široko replikacijo s strani tretjih oseb je še prezgodaj.

Zakaj so zanke od stanja do dejanja tako pomembne za agentno kodiranje?

Agentsko kodiranje je pogosto binarno: test je ali zelen, zato čiste izbire dejanj premagajo lepe eseje o neuspehu. Zakasnitev se kopiči v številnih korakih orodja - skrajša se čas na korak, stenska ura in računi za oblak pa se premikajo. Domnevna pospešitev za velikostni red v primerjavi z vrstnikom razreda Jev, tudi če v naravi pristane "le" kot 4×, še vedno prerazporedi načrtovanje zmogljivosti. Hibridni skladi - hiter krmilnik, podoben CLM, in težji sistem za sklepanje na trdih vejah - so realistična dolgoročna oblika.

Ali naj zaupam rezultatom DeepSWE in Terminal-Bench za CLM-8B?

Ti paketi kaznujejo krhke agente, zato je ~81,6 % DeepSWE in ~87,6 % Terminal-Bench 2.1 po lahki fini nastavitvi videti vznemirljivo. Agentske klopi nagrajujejo tudi odra: kakovost pasov, seznami dovoljenih orodij in pozivi k obnovitvi lahko uspeh dvignejo za dvomestno število točk. Preden grafikon obravnavate kot ustaljeno znanost, se poglobite v to, kakšen ovoj je bil okoli uteži. Avtorske klopi se tržijo, dokler jih nekdo drug ne reproducira z dokumentiranimi recepti.

Kaj moram vedeti o CLM-35B in natančnem nastavljanju modela 8B?

Kot načrt se omenja večje nadaljevanje CLM-35B; ali bo ohranil zgodbo o zakasnitvi ali bo hitrost zamenjal za globino, ni jasno. Realistična pot do močnih številk je natančnejša prilagoditev CLM-8B lastnim pravilom lint, uvedba CLI in sledi monorepozitorija – ne pa magija ničelnega zadetka prvi dan. Ekipe lahko obdržijo obe velikosti, če uspejo: 8B za vroče zanke, 35B za zahtevno načrtovanje. Odprte uteži olajšajo tudi zlorabo, zato so varovalne ograje in omejitve hitrosti produkt, ne pa neobvezen cosplay.

Kako naj berem Jevove primerjave, ne da bi me zasul sneg?

Primerjave razreda Jev dajejo "do 9× hitrejše" sidro vrstnika, kar pomaga, da se ponudba uveljavi. Nevarnost je, da se velikost serije, natančnost, dolžina konteksta in serializacija klicev orodij zdrobijo v en sam množitelj. Ko chatter navaja odgovore razreda ~32 ms, vprašajte, ali to pomeni prvi žeton, JSON s polnim dejanjem ali predpomnjeno predpono. Izmerite uspeh naloge, dolar na rešeno zahtevo in stopnjo človeškega posredovanja na vašem skladu. Narative o rivalstvu silijo laboratorije, da objavijo številke; vaši produkcijski KPI-ji še vedno odločajo.

Kaj naj gradbeniki storijo, preden v proizvodne materiale vgradijo CLM-8B?

Izdelajte si odsek, ki je kritičen glede zakasnitve – na primer terminalsko mikrozanko – in ga z A/B metodo natančno prilagodite svojemu trenutnemu delovnemu konju, pri čemer ostanite nespremenjeni. Pazite na napačna, a hitra dejanja; dodajte preverjanje, dajte prednost reverzibilnim orodjem in v proračun vključite počasnejši modul za sklepanje, ko je zaupanje nizko. Spremljajte dejanja na sekundo na grafični procesor, ne le žetone na sekundo. Ne lepite produkcijskih skrivnosti v eksperimentalne agente in na vsakem grafikonu tiska pustite nalepko CLAIM, dokler ne pristanejo vaši lastni zaporedji.

Kako zgradim oceno mikrozanke s pošteno zakasnitvijo za zahtevke CLM-8B Just Dropped?

Zamrznite majhen nabor sledi dejanskih neuspelih testov, ohranite isto shemo orodja in seznam dovoljenih v vseh modelih ter beležite korake, stensko uro, uspeh in človeške posege. Uporabite CLM-8B samo v koraku »izberite naslednje reverzibilno dejanje«, če ohranite premišljeno loputo za pobeg za nove zahteve. Označite avtorja ~9×, DeepSWE in milisekundne številke kot ZAHTEVEK, dokler ta povezava ne pokaže zmage pri skupnem uspehu in zakasnitvi. To osredotočeno eval premaga prepisovanje produkcije na diapozitivu.

Reference

  1. Objemajoči obraz — kontrastivni jezikovni model (CLM-v0.1-8B) — huggingface.co
  2. GitHub — Kontrastivno-LM / CLM — github.com
  3. Univerza Stanford — Azalia Mirhoseini — cs.stanford.edu
  4. Jacky Kwok — jackyk02.github.io
  5. X — Predstavitev Jackyja Kwoka — x.com
  6. DeepSWE — deepswe.datacurve.ai
  7. Snorkel AI — Terminal-Bench 2.1 — snorkel.ai
  8. Jev — jevtypesafeai.com
Kviz
1. Za kaj je CLM-8B primarno pozicioniran?

2. Kako naj obravnavate trditev »do približno 9× hitrejši od Jeva«?

3. Kaj članek priporoča pri A/B testiranju CLM-8B v primerjavi z vašim trenutnim delovnim strojem?

4. Kateri hibridni pristop k skladanju članek predlaga za resne agentske sisteme?

5. Kaj naj gradbeniki storijo pred odpremo komercialnih vilic CLM-8B?


Nazaj na blog