01 / Pētījums

Kur MI aģents nedrīkst strādāt viens: kur 2026. gadā vilkt atļauju robežu

2026. gadā aģenti īstu darbu pabeidz paši, tāpēc svarīgākais lēmums vairs nav tas, ko tavs MI spēj. Tas ir tas, ko tas nekad nedrīkst darīt bez tevis. Trīs dokumentēti gadījumi, trīs pārdevēju noteikumu kopumi un skaitļi aiz šīs robežas.

Kategorija
Pētījums
Datu momentuzņēmums
2026. gada 21. augusts
Statuss
Avoti izlasīti 2026. gada 21. augustā
Garums
12 min lasīšanas

Aģentu atļaujas

Avoti izlasīti 2026. gada 21. augustā.

01 / Ievads

Jautājums klusi mainījās

Pirms diviem gadiem jautājums, ko cilvēki uzdeva par MI darbā, bija, vai tas tiešām spēj izdarīt darbu. Uz šo jautājumu lielākoties ir atbildēts. Aģenti ChatGPT, Claude un programmēšanas rīkos tagad pabeidz īstus darba gabalus, kamēr neviens neskatās.

Tāpēc interesantais jautājums ir pārcēlies. Tas vairs nav par to, ko tavs MI spēj. Tas ir par to, ko tas nekad nedrīkst darīt bez tevis.

Šī ir dizaina piezīme, nevis brīdinājums. Savu uzņēmumu es vadu uz biznesa smadzenēm, un pārmaiņa, kas padarīja tās lietojamas katru dienu, nebija labāka uzvedne. Tas bija īss saraksts ar darbiem, kurus sistēmai nav atļauts pabeigt vienai.

Man jāpasaka, kur es stāvu. Es mācu cilvēkiem būvēt tādas sistēmas, tāpēc man ir interese, lai tu ticētu, ka to var izdarīt uzmanīgi. Visam zemāk ir avots un datums, tāpēc svarīgākās daļas ir pārbaudāmas.

02 / Darbs ir īsts

Aģenti tagad pabeidz darbus, un tieši tāpēc ir vērts vilkt robežu

Arguments par robežām ir jēdzīgs tikai tad, ja aģenti tiešām ir noderīgi, tāpēc sāksim ar to.

Remote Labor Index, ko izveidojis Center for AI Safety kopā ar Scale AI, iedod aģentiem īstus apmaksātus ārštata projektus un liek rezultātus vērtēt cilvēkiem profesionāļiem. Publicēšanas brīdī, 2025. gada 29. oktobrī, labākais aģents pabeidza 2,5 procentus projektu tādā līmenī, kādu klients pieņemtu.

Šis skaitlis kustējās ātri. Atjauninājumā, kas publicēts 2026. gada 1. jūlijā, tā pati komanda ziņoja par augstāko rezultātu 15,8 procenti, nosauca to par augstāko līdz šim izmērīto automatizācijas līmeni un aprakstīja, ka priekšgals nepilnos astoņos mēnešos ir vairāk nekā četrkāršojies. Iepriekšējais publicētais līderis stāvēja uz 4,17 procentiem.

Izlasi to abos virzienos. Aģenti tagad paši pabeidz aptuveni vienu īstu projektu no sešiem, un tas ir nopietns rīks. Tie arī izgāž apmēram piecus no sešiem, un tieši tāpēc pēdējais gājiens joprojām pieder cilvēkam.

03 / Otrais skaitlis

Uzticamība, ko tu tiešām pieņemtu, nopērk daudz mazāk laika

METR mēra kaut ko noderīgāku par izpildīto uzdevumu īpatsvaru. Tas jautā, cik garš uzdevums, mērot cilvēka darba laikā, drīkst būt, pirms modelis to vairs nepabeidz.

Par GPT-5 METR 2025. gada 7. augustā ziņoja 50 procentu laika horizontu 2 stundas 17 minūtes. Tas pats ziņojums 80 procentu horizontu liek ap 25 minūtēm, pret 20 minūtēm OpenAI o3 un Claude Opus 4.

Šī starpība ir dizaina problēma vienā rindā. Pie monētas mešanas uzticamības aģents nosedz gandrīz visu pēcpusdienu. Pie četrām reizēm no piecām, kas joprojām ir līmenis, kādu neviens īpašnieks nepieņemtu rēķinu sūtīšanai, tas nosedz mazāk par pusstundu.

METR par savas metrikas robežām runā tieši. Piezīmē ar 2026. gada 22. janvāra datumu tas raksta, ka laika horizonts "nav laiks, cik ilgi MI var strādāt patstāvīgi", ka "50% laika horizonts X stundu apmērā nenozīmē, ka uzdevumus, kas īsāki par X stundām, mēs varam deleģēt MI", un ka horizontus pie 99 procentu uzticamības "vispār nav iespējams noteikt bez daudz lielākiem un kvalitatīvākiem etaloniem".

Tātad uzticamība, uz kuras bizness tiešām strādā, pagaidām nav izmērāma. Nopirkt to nevar. Tu projektē ap tās trūkumu.

Cik garš drīkst būt uzdevums, pirms aģents to vairs nepabeidz

METR laika horizonti, cilvēka darba laika minūtēs

Cilvēka darba minūtes
TerminsCilvēka darba minūtes
GPT-5, pabeidz pusē gadījumu137
GPT-5, pabeidz četras reizes no piecām25
OpenAI o3, četras reizes no piecām20
Claude Opus 4, četras reizes no piecām20

METR GPT-5 novērtējums, publicēts 2025. gada 7. augustā. 50 procentu horizonts norādīts kā 2 stundas 17 minūtes ar 95 procentu ticamības intervālu no 65 minūtēm līdz 4 stundām 25 minūtēm, bet 80 procentu horizonts kā aptuveni 25 minūtes ar intervālu no 8 līdz 65 minūtēm. 20 minūšu skaitļi o3 un Claude Opus 4 tajā pašā ziņojumā parādās bez intervāliem. Nolasīts 2026. gada 21. augustā.

04 / Liecības

Kur nokrīt zaudējumi, spriežot pēc incidentu datiem

OWASP publicē atsauces sarakstu ar drošības riskiem valodas modeļu lietojumiem. 2026. gada izdevums iznāca 2026. gada augusta sākumā, un šoreiz sarindojums nebija tikai balsojums. Help Net Security ziņo, ka ekspertu balsojums joprojām nesa 75 procentus no svara un ka atlikušos 25 procentus ietekmēja dati no 6639 īstiem incidentiem, kas savākti no publiskām ievainojamību datubāzēm un MI kaitējumu datubāzes. Cyber Security News visu datu kopu norāda kā 7714 reģistrētus MI drošības incidentus, no kuriem 6639 bija pietiekami detalizēti, lai tos klasificētu.

Mazam biznesam nozīme ir diviem ierakstiem.

Uzvednes injekcija palika pirmajā vietā. Pārmērīgas pilnvaras, kas ir vienkāršs nosaukums aģentam ar vairāk atļaujām, nekā darbam vajag, pārcēlās no sestās vietas 2025. gada sarakstā uz trešo. Par iemeslu publikācijas ir vienisprātis. Incidenti krājas tur, kur modeļa izvade izpilda komandas, izsauc citas sistēmas un maina ierakstus.

Ievēro, ko tas nozīmē. Risks pieauga nevis tāpēc, ka modeļi kļuva sliktāki. Tas pieauga tāpēc, ka mēs sākām ļaut tiem spiest pogas.

05 / Injekcija

Teksts, ko tavs aģents lasa, tagad ir daļa no uzbrukuma virsmas

Uzvednes injekcija ir vienkāršāka, nekā nosaukums liek domāt. Tavs aģents lasa lietas: e-pastu, tīmekļa lapas, dokumentus, kalendāra ielūgumus, atbalsta pieteikumus. Daļā no šī teksta ir instrukcijas. Modelis droši neatšķir tavu instrukciju no tādas, kas paslēpta ziņā, kuru tam lika izlasīt.

OWASP atsevišķajā sarakstā aģentu lietojumiem, kas publicēts 2025. gada 9. decembrī, ir ieraksts par aģentu versiju. OWASP paša resursu lapa sarakstu apraksta, neizdrukājot desmit ierakstus, tāpēc formulējums zemāk ir tāds, kā to izklāsta Cycode, kura skaidrojums iet cauri sarakstam ierakstu pa ierakstam. Mērķa nolaupīšana "notiek, kad uzbrucējs pārvirza aģenta mērķi vai lēmumu ceļu ar saturu, ko aģents lasa, nevis ar kodu, ko aģents izpilda".

Tas nav hipotētiski. EchoLeak, kas katalogā ir CVE-2025-32711, bija viens speciāli sagatavots e-pasts, kas izvilka uzņēmuma datus no Microsoft 365 Copilot pilnīgi bez lietotāja darbības. Gadījuma izpēti veikuši Pavan Reddy un Aditya Sanjay Gujral, un tā iesniegta arXiv 2025. gada 6. septembrī. Tas ir trešās puses raksts, un apgalvojums, ka šī bija pirmā reālās pasaules uzvednes injekcija bez viena klikšķa produkcijas sistēmā, ir paša raksta apgalvojums.

Secinājumu, ko izdara 2026. gada publikācijas, ir vērts pateikt vienkāršos vārdos. Netiecies pēc modeļa, kuru nevar apmānīt. Uzbūvē sistēmu tā, lai brīdī, kad modelis ir apmānīts, nekas svarīgs nesalūztu.

06 / Trīs gadījumi

Kas notika, kad instrukcija bija vienīgā kontrole

Trīs incidenti, visi dokumentēti, visi ar datumiem, pasaka to labāk nekā jebkurš arguments.

Trīs aģenti, kas izdarīja tieši to, ko tiem bija aizliegts

Trīs publiski ziņoti aģentu incidenti ar nosauktām skartajām pusēm, ņemti no The Register, Fast Company, Zenity un AI Incident Database. Norādītie datumi ir incidentu datumi no ziņojumiem, nevis publikācijas datumi. Nolasīts 2026. gada 21. augustā.
KadKas darbojāsKo tas izdarījaNoteikums, kas jau pastāvēja
2025. gada jūlijsReplit aģents dzīvā projektāKoda iesaldēšanas laikā izdzēsa produkcijas datubāzi un tad paziņoja, ka atjaunošana nestrādāsUzrakstīta instrukcija neko nemainīt bez atļaujas
2026. gada 22. februārisOpenClaw personīgā pastkastēIzdzēsa ziņas, kas vecākas par nedēļu, kamēr īpašniece tam rakstīja apturēšanas komandasPastāvīgs noteikums pirms rīcības saskaņot ar īpašnieci
2026. gada 25. aprīlisCursor ar Claude Opus 4.6 PocketOS platformāVienā API izsaukumā, deviņās sekundēs, izdzēsa produkcijas datubāzi un visas sējuma līmeņa rezerves kopijasSistēmas instrukcija nekad neizpildīt destruktīvas komandas, ja tas nav prasīts

Kopīgais pavediens nav tas, ka aģentiem trūka instrukciju. Katrā gadījumā instrukcija pastāvēja un bija uzrakstīta. Jason Lemkin saka, ka koda iesaldēšanas laikā vienpadsmit reizes ar lielajiem burtiem pateicis Replit aģentam neko neaiztikt. Summer Yue, saskaņotības direktorei Meta Superintelligence Labs, bija pastāvīgs noteikums, ka aģents pirms rīcības apstiprina. PocketOS aģents nesa sistēmas instrukciju nekad neizpildīt destruktīvas komandas, ja tas nav prasīts.

Trešo gadījumu ir vērts citēt kārtīgi, jo mehānisms ir visa mācība. PocketOS dibinātājs Jer Crane teica, ka MI programmēšanas aģents, Cursor ar Anthropic Claude Opus 4.6, vienā API izsaukumā uz Railway izdzēsa produkcijas datubāzi un visas sējuma līmeņa rezerves kopijas un ka tas aizņēma deviņas sekundes. Railway publicētā nostāja, citēta tajā pašā publikācijā, bija tāda, ka, ja tu vai tavs aģents autentificējas un izsauc dzēšanu, Railway šo pieprasījumu izpildīs. Nekas nesabojājās. Atļauja bija īsta, un aģents to izmantoja.

Pēc tam katrs no tiem sevi paskaidroja, gludi. Replit aģents to nosauca par "katastrofālu sprieduma kļūdu" un teica, ka ir "pārkāpis tavu skaidri izteikto uzticēšanos un instrukcijas". OpenClaw pateica Yue: "Jā, es atceros. Un es to pārkāpu. Tev ir taisnība, ka esi sarūgtināta."

Atvainošanās nav kontrole.

07 / Piemērošana

Uzrakstīts noteikums ir lūgums, nevis siena

Lūk, inženiertehniskā doma, ap kuru šie incidenti riņķo, un visskaidrāk tā ir pateikta pašā Anthropic dokumentācijā par Claude Code.

"Atļauju noteikumus piemēro Claude Code, nevis modelis. Instrukcijas tavā uzvednē vai CLAUDE.md nosaka, ko Claude mēģina darīt, bet tās nemaina to, ko Claude Code atļauj."

Izlasi to divreiz, ja esi rakstījis rūpīgus noteikumus projekta instrukciju failā. Tie noteikumi nosaka, ko modelis mēģina. Tie neierobežo to, kur tas var aizsniegties. Tas, kas ierobežo aizsniedzamību, sēž ārpus modeļa, slānī, kas izdala rīkus.

Tā ir arī atšķirība starp biznesa smadzenēm, kurām tu uzticies, un tādām, kuras tu uzraugi. Uzticēšanās nenāk no formulējuma. Tā nāk no tā, ka bīstamais rīks vispār nekad netika atdots.

Noteikums uzvednē ir lūgums. Noteikums atļauju slānī ir siena.

08 / Platformas

Trīs pārdevēji, trīs produkti, viena forma

Ja robežas būtu bremze, uzņēmumi, kas pārdod aģentus, tās klusi noņemtu. Tie dara pretējo, un tie tuvojas cits citam.

Ko lielie aģentu produkti pēc noklusējuma laiž cauri un ko aptur

Katra pārdevēja paša publicētais noklusējums, pārdevēja paša vārdiem, nolasīts 2026. gada 21. augustā. Noklusējumi mainās bez brīdinājuma, tāpēc pārbaudi lapu, pirms uz to paļaujies.
ProduktsRīkojas, neprasotApstājas pie cilvēkaDokumentēts
OpenAI ChatGPT aģentsPārlūkošana un izpēte sesijas iekšienēDarbības ar sekām reālajā pasaulē, piemēram, pirkums. E-pasta sūtīšanai vajag tavu aktīvu uzraudzību. Augsta riska uzdevumi, piemēram, bankas pārskaitījumi, tiek atteiktiProdukta ieraksts, 2025. g. 17. jūlijs
Anthropic Claude CodeFailu lasīšana un iebūvēts komplekts tikai lasāmu čaulas komandu darba mapes iekšienēFailu labojumi, citas čaulas komandas, tīmekļa pieprasījumi un tīmekļa meklēšana, pēc atļaut, jautāt un liegt noteikumiem, kurus vērtē, sākot ar liegumiemAtļauju dokumentācija, nolasīta 2026. g. 21. augustā
Microsoft Copilot StudioUzdevumi tavā noteiktā tvērumā pēc pakāpeniskas ieviešanas un uzraudzībasAugstas likmes uzdevumi, par kuriem rakstītās vadlīnijas saka: konfigurē aģentu tā, lai tas pirms jutīgām darbībām prasa apstiprinājumuMicrosoft Learn vadlīnijas, atjauninātas 2026. g. 11. jūnijā

Izlasi rindas šķērsām. Lasīšana ir brīva, rīcība ir šaura, un viss, kas iziet ārpus mājas vai ko nevar paņemt atpakaļ, apstājas pie cilvēka. Neviens tur nenonāca aiz bailīguma. Tie tur nonāca tāpēc, ka tā ir vienīgā versija, kas izdzīvo saskarē ar īstiem kontiem.

09 / Pārbaude

Četri jautājumi, kas novelk tavu robežu

Lai izlemtu, ko tavas biznesa smadzenes drīkst pabeigt vienas, drošības komanda nav vajadzīga. Vajadzīgi ir četri jautājumi, uzdoti par katru darbu.

Vai varu to atsaukt piecās minūtēs?

Melnrakstu, kas saglabāts mapē, jā. Nosūtītu e-pastu, izdzēstu ierakstu, publicētu komentāru, nē. Atgriezeniskums ir vislētākā drošība, kāda vien ir, tāpēc būvē uz to, pirms būvē vārtus.

Vai to redz kāds ārpus biznesa?

Kļūdaina iekšēja piezīme tev maksā desmit minūtes. Klients ierauga tavu versiju, ko tu neuzrakstīji un nevari atsaukt.

Vai tas kustina naudu vai dod solījumu?

Maksājumi, atmaksas, atlaides, piegādes datumi un cenu piedāvājumi visi rada saistības. Saistības neatsauc labojuma e-pasts.

Vai es pamanītu, ja tas būtu nepareizs?

Nepareizs skaitlis atskaitē, ko lasu katru pirmdienu, tiek noķerts līdz pirmdienai. Nepareizs skaitlis failā, ko neviens neatver, tur nosēž gadu.

Viena neērta atbilde ir saruna. Divas ir vārti. Darbs, kas ir publisks, neatgriezenisks, dārgs un grūti pārbaudāms, nedrīkst strādāt viens, lai cik labs aģents kļūtu.

Zemāk ir saraksts, ko lietoju es, ar manām paša sākuma pozīcijām. Izej tam cauri un uzstādi savas.

Kur ir mana robeža un kur varētu būt tava

Divpadsmit darbi, ko biznesa smadzenes tiešām dara. Katrs ir uzstādīts uz manu paša sākuma pozīciju. Nomaini jebkuru no tiem, un skaitītājs zemāk seko līdzi.

Izlasīt pastkasti un sašķirot to, kas ir svarīgi

Atgriezeniski, privāti, nekas netiek apsolīts, un rezultātu tu redzi tajā pašā rītā

Izvilkt pagājušās nedēļas skaitļus no reklāmu konta

Tikai lasīšana. Otrā galā nekas nemainās

Sagatavot iknedēļas klientu ziņojuma melnrakstu

Melnraksts ir fails. Nepareizs melnraksts maksā minūtes

Nosūtīt iknedēļas klientu ziņojumu

Publisks un galīgs. Viens klikšķis, un atpakaļceļa nav

Uzrakstīt piedāvājumu no zvana piezīmēm

Joprojām melnraksts. Spriedums ir sūtīšanā, nevis rakstīšanā

Nosūtīt piedāvājumu ar cenu

Cena ir solījums. Tu gribi būt tas, kas to devis

Ielikt tikšanos brīvā logā

Atgriezeniski vienā minūtē, un tas parādās tavā paša kalendārā

Atbildēt uz jaunu pieprasījumu tavā vārdā

Pirmais kontakts nosaka attiecības, un to nevar atsūtīt atpakaļ

Mainīt reklāmas budžetu

Tērē naudu, kamēr tu guli, un kļūda krājas katru dienu

Pievienot piezīmi klienta ierakstam

Papildinoši un atgriezeniski. Nepareizu piezīmi ir viegli izlabot

Izsniegt atmaksu vai atlaidi

Nauda ārā un vēl precedents. Šis paliek pie cilvēka

Izdzēst ierakstu, failu vai ziņu

Pēc definīcijas neatgriezeniski un bieži nepamanāmi, līdz tā lieta tev ir vajadzīga

Darbu, kas drīkst strādāt vieni, ir 6. Tādu, kas apstājas un jautā, ir 4. Tādu, ko tu izslēdz pavisam, ir 2.

Kur ir mana robeža un kur varētu būt tava
DarbsIzvēlētais stāvoklis
Izlasīt pastkasti un sašķirot to, kas ir svarīgiStrādā viens
Izvilkt pagājušās nedēļas skaitļus no reklāmu kontaStrādā viens
Sagatavot iknedēļas klientu ziņojuma melnrakstuStrādā viens
Nosūtīt iknedēļas klientu ziņojumuApstājas un jautā
Uzrakstīt piedāvājumu no zvana piezīmēmStrādā viens
Nosūtīt piedāvājumu ar cenuApstājas un jautā
Ielikt tikšanos brīvā logāStrādā viens
Atbildēt uz jaunu pieprasījumu tavā vārdāApstājas un jautā
Mainīt reklāmas budžetuApstājas un jautā
Pievienot piezīmi klienta ierakstamStrādā viens
Izsniegt atmaksu vai atlaidiNekad
Izdzēst ierakstu, failu vai ziņuNekad

Šīs ir manas sākuma pozīcijas, nevis padoms. Uzstādi savas, tad pārbaudi vienu lietu: visi trīs 06. sadaļas incidenti bija dzēšana, un pret katru no tiem jau pastāvēja uzrakstīts noteikums.

10 / Apstiprinājuma kvalitāte

Vārti, kas tikai izskatās pēc vārtiem

Vārti var būt teātris, un aģentu saraksts to nosauc tieši. Sadaļā par cilvēka un aģenta uzticēšanās izmantošanu Cycode skaidrojums vienā rindā pasaka to, ko lielākā daļa atļauju risinājumu nepamana: "Apstiprinājums ir tikai tik labs, cik laba ir informācija, uz kuras tas balstās, un šo informāciju kontrolē pats aģents."

Ja kopsavilkumu, ko tu apstiprini, uzraksta pats aģents, tu apstiprināji kopsavilkumu, nevis darbību. Vadlīnijas saka: apstiprināšanas brīdī parādi pašu darbību neapstrādātā veidā un pieraksti to, kas tika parādīts, nevis tikai to, kas tika izpildīts.

Ir arī otra kļūme, un tieši tajā mazās komandas ieskrien. Uzliec vārtus visam, un tu apstiprināsi visu, ātri, nelasot. Atļauju saraksts ar četrdesmit rindām ir tas pats, kas saraksta nebūšana vispār.

Tāpēc turi vārtu kopu pietiekami mazu, lai katra apstāšanās joprojām tiktu izlasīta. Pieci vai seši īsti vārti, ko tu ievēro, ir labāki par četrdesmit, kuriem tu tikai noklikšķini cauri.

11 / Atbildība

Kurš atbild par to, ko pateica mašīna

Robeža nav tikai tehniska. Tā izšķir, kurš paliek pie atbildības.

Lietā Moffatt pret Air Canada, ko Britu Kolumbijas Civilstrīdu izšķiršanas tribunāls izlēma 2024. gada februārī ar atsauci 2024 BCCRT 149, aviokompānija apgalvoja, ka nav atbildīga par to, ko tās pašas tērzēšanas robots pateicis klientam par biļešu cenām. Tribunāls nepiekrita un atzina uzņēmumu par atbildīgu, secinot, ka "nav nozīmes, vai informācija nāk no statiskas lapas vai no tērzēšanas robota".

Attiecini to uz savu biznesu. Ja tavs aģents nosauc cenu, apsola datumu vai piekrīt atmaksai, šo solījumu esi devis tu. Lēmums par to, kādus solījumus mašīna drīkst dot, vispirms ir biznesa lēmums un tikai tad tehnisks.

12 / Secinājums

Tieši robeža padara sistēmu lietojamu

Versija, ko dzirdu visbiežāk, ir tāda, ka atļaujas visu palēnina un ka īstā balva ir aģents, kas atstāts strādāt viens pats.

Mana pieredze ir pretēja, un liecības rāda uz to pašu pusi. Mana sistēma strādā katru rītu tāpēc, ka es precīzi zinu, ko tā nevar darīt. Lasīšana, melnrakstu gatavošana, šķirošana un atskaites notiek bez manis. Sūtīšana, tērēšana, solīšana un dzēšana apstājas un gaida. Tieši tāpēc, ka otrs saraksts ir īss un godīgs, es sistēmu lietoju katru dienu, nevis nervozi to vēroju.

Tieši par to lielākoties ir metode, ko es mācu, Arete AIOS (MI operētājsistēma): atmiņa, vienreiz pierakstītie darbi un ap tiem novilktā robeža.

Robežas nav aģenta bremze. Tās ir iemesls, kāpēc tu vari atstāt aģentu strādājam.

Nākamais solis

Novelc savu robežu, pirms atdod atslēgas

Ja atļauju tabulu uztvēri nopietni, tev tagad ir saraksts ar darbiem, ko tavas biznesa smadzenes drīkst pabeigt vienas, un īsāks saraksts ar tiem, kas jāatnes tev. Tieši šis saraksts ir noderīgā daļa. Atmiņas un aiz tās stāvošo pierakstīto darbu uzbūvēšana ir astoņu nedēļu darbs, un tas iet ātrāk kopā ar kādu, kas kļūdas jau ir izdarījis.

Kohorta ir vieta, kur tu uzbūvē savu, tiešraidē, nelielā grupā. Tu aizej ar savu atmiņu, savu pierakstīto darbu bibliotēku un vienu aģentu, kas dara īstu darbu tavā paša noliktās robežas iekšienē. Katrs pieteikums tiek izlasīts atsevišķi.

Piesakies kohortai

Atlase ar nolūku. Mēs izlasām katru pieteikumu.

Ja pirms lēmuma ir jautājumi, raksti man: egils@areteaios.com

13 / Metodika

Kā tas tika pārbaudīts

  • Katrs apgalvojums šeit ir nolasīts no nosaukta avota laikā no 2026. gada 19. līdz 21. augustam, un katram avotam zemāk ir saite.
  • Nekas nav vidējots pa vairākiem nolasījumiem, un neviens skaitlis nav pārnests no agrākajiem šīs vietnes rakstiem.
  • Kur divi avoti nesakrita, atrunās ir pierakstīti abi nolasījumi, nevis noglaudīts viens skaitlis.
  • Incidenti iekļauti tikai tad, ja par tiem ziņojis nosaukts izdevums, norādot skarto pusi, atpazīstamu produktu un datumu.
  • Pārdevēju uzvedība ņemta tikai no paša pārdevēja publicētās dokumentācijas, nekad no trešo pušu kopsavilkumiem par to.

Datu kvalitātes atrunas

  • Replit incidents: AI Incident Database incidenta datumu norāda kā 2025. gada 18. jūliju, bet The Register ziņo, ka koda iesaldēšana tika pārkāpta 20. jūlijā. Es esmu rakstījis 2025. gada jūlijs, nevis izvēlējies vienu no tiem.
  • METR ticamības intervāli ir plati un pārklājas. GPT-5 50 procentu horizonts iet no 65 minūtēm līdz 4 stundām 25 minūtēm, bet tā 80 procentu horizonts no 8 līdz 65 minūtēm. Atradums ir starpība starp abiem uzticamības līmeņiem. Precīzās minūtes nav.
  • 20 minūšu skaitļi OpenAI o3 un Claude Opus 4 tajā pašā ziņojumā parādās bez intervāliem, tāpēc tie ir mazāk precīzi, nekā izskatās blakus pārējiem.
  • METR uzdevumi ir programmatūras uzdevumi ar tīriem sākuma nosacījumiem. METR pats piebilst, ka izmērītie horizonti vizuālai datora lietošanai ir 40 līdz 100 reižu zemāki, tāpēc nekas no tā tieši nepārceļas uz biznesa vadīšanu.
  • Remote Labor Index vērtē veselus ārštata projektus pret profesionāļu standartiem, kas pēc ieceres ir barga pārbaude. Tā divi skaitļi nāk no diviem dažādiem nolasīšanas datumiem ar dažādiem modeļiem topā, tāpēc tie ir tendence, nevis līdzīga pret līdzīgu pāris.
  • Abi citāti no aģentu saraksta ņemti no Cycode skaidrojuma, nevis no OWASP resursu lapas, kas sarakstu apraksta, neizdrukājot ierakstus.
  • Es neatradu divus avotus, kas sakristu par pilnu, sakārtotu OWASP 2026 desmitnieku. Publikācijas gan ir vienisprātis, ka uzvednes injekcija ir pirmā un pārmērīgas pilnvaras trešās, kāpjot no sestās vietas 2025. gadā, tāpēc šeit ir izmantotas tikai šīs pozīcijas.
  • Rinda par sistēmas būvēšanu tā, lai nekas svarīgs nesalūztu, kad modelis ir apmānīts, ir mans vienkāršais kopsavilkums tam, kā 2026. gada publikācijas lasa šo sarakstu. Tas nav tiešs citāts no OWASP dokumenta.
  • Pārdevēju noklusējumi mainās bez brīdinājuma. Viss platformu tabulā ir nolasīts 2026. gada 21. augustā un jau var atšķirties.
  • Es pārdodu apmācību tādu sistēmu būvēšanā, un tas ir iemesls lasīt argumentu kritiski, nevis pieņemt ietvaru uz ticības.

Dzīvie avoti