Rekordní skóre potřebuje rodný list

Model vyřešil úlohu napoprvé. Druhý potřeboval dvacet pokusů a nápovědu, kdy konečně trefil správnou odpověď. V reklamním grafu mohou oba skončit se stejným skóre. Jenže ve vaší aplikaci bude rozdíl mezi nimi bolet. Časem, penězi a občas i průšvihem.
Britský UK AISI a koalice EvalEval chtějí podobná srovnání zprůhlednit. Jejich spolupráce míří na slabinu celého odvětví: výsledky testů zveřejňujeme ochotně. Přesný recept, jak vznikly, už méně.
Rekordní skóre potřebuje rodný list
Koalice EvalEval oznámila 22. září 2026, že britský AI Security Institute využívá její infrastrukturu ke sdílení výsledků evaluací. Základem je společné schéma Every Eval Ever, zkráceně EEE, a platforma Evaluation Cards. Ta propojuje výsledky s informacemi potřebnými k jejich interpretaci. Oznámení EvalEval.
Zveřejněná sada zahrnuje pět hlavních benchmarků: HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro a Terminal-Bench 2.0. Pokrývá šest modelů: Claude Opus 4, 4.5 a 4.6 a GPT-5, GPT-5.2 a GPT-5.4. Připojené kybernetické evaluace Cyber CTFs a The Last Ones používají jinou, částečně překrývající se sestavu.
Smyslem není přidat další tabulku vítězů. Výsledek má dostat něco jako rodný list. Jaká konfigurace ho vytvořila? Jaké nástroje měl model k dispozici? Kolik výpočetního prostoru dostal? Bez těchto údajů nelze poznat, zda porovnáváme schopnosti modelů, nebo štědrost jejich provozovatelů.
Zveřejněný záznam přitom automaticky nezaručuje, že každý experiment zopakujete doma. Komerční model může být dostupný pouze přes rozhraní poskytovatele. Některá data mohou mít omezený přístup. Rozsáhlé měření může být drahé.
Přínos je přesto hmatatelný. Další tým snáz zjistí, co potřebuje zopakovat a které informace chybějí. A zákazník může dodavateli položit konkrétnější otázku než oblíbené „a umí to dobře česky?“.
Nehodnotíme jen model. Hodnotíme celý postup
AISI ve studii o výpočetních nárocích evaluací doporučuje vykazovat schopnosti jako funkci výpočetního rozpočtu při generování odpovědí. Protokol testování má být výslovně popsaný a modely porovnávané při odpovídajících rozpočtech. Studie AISI.
Prakticky: dejte dvěma systémům stejné úlohy, ale také srovnatelné podmínky. Pokud jeden dostane desetkrát více pokusů, testujete jinou službu. Může být užitečnější. Jen potřebujete vědět, kolik její výhoda stojí.
Zvláštní pozornost zaslouží zpětná vazba od hodnotitele, který zná správné řešení. Model může zkoušet další odpovědi, dokud neuslyší „správně“. V běžném provozu takový vševědoucí rozhodčí často chybí. Právě proto nelze úspěšnost celého hledání zaměnit za pravděpodobnost správné první odpovědi.
EEE umožňuje u agentních evaluací zachytit dostupné nástroje, limity zpráv a tokenů nebo konfiguraci izolovaného prostředí. To jsou údaje, které se do marketingového sloupce nevejdou, ale pro opakování experimentu rozhodují. Repozitář EEE.
Pro vlastní test si navíc předem určete pravidla neúspěchu. Počítá se překročení času jako chyba? Co nedostupné rozhraní? Smí se pokus automaticky opakovat? Dodatečné vyřazování nepovedených běhů dokáže výsledky pěkně naleštit.
A nezapomeňte na nejistotu. Rozdíl několika správných odpovědí na malé sadě ještě nemusí znamenat lepší model. Opakované běhy pomohou odhalit kolísání. Rozmanitější zadání zase ukážou, zda úspěch nestojí na jedné úzké kategorii.
Chcete ušetřit na energiích?
Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.
Spočítat úsporu →Vlastní zkouška: Inspect, Ollama a několik řádků Pythonu
Pro malý lokální experiment lze použít otevřený evaluační nástroj Inspect od AISI a Ollamu. Inspect podporuje také Hugging Face a vLLM, takže později můžete měnit způsob provozu modelu bez přepisování celého testu. Dokumentace poskytovatelů.
Následující ukázka předpokládá Linux, Python s podporou virtuálních prostředí a nainstalovanou, spuštěnou Ollamu. Jde o jednoduchou kontrolu funkčnosti, nikoli o náhradu profesionálního benchmarku.
```bash python -m venv .venv source .venv/bin/activate pip install inspect-ai openai ollama pull llama3.2:3b ```
Do souboru `zkouska.py` vložte vlastní úlohu:
```python from inspect_ai import Task, task from inspect_ai.dataset import Sample from inspect_ai.scorer import exact from inspect_ai.solver import generate
@task def prevod_energie(): return Task( dataset=[ Sample( input=( "Kolik kWh jsou 2 MWh? " "Odpověz pouze celým číslem bez jednotky." ), target="2000", ) ], solver=generate(), scorer=exact(), ) ```
Pak spusťte měření a prohlížeč záznamů:
```bash inspect eval zkouska.py --model ollama/llama3.2:3b inspect view pip freeze > requirements.txt ollama list ```
Základní stavba úlohy odpovídá principům návodu Inspect. Přesná shoda zde záměrně hodnotí i dodržení formátu. Odpověď „2000 kWh“ může selhat, přestože převod je správný. U skutečného testu proto oddělte věcnou správnost od požadovaného formátu.
Soubor závislostí archivujte společně s úlohou a záznamy. Přidejte verzi Pythonu, Ollamy, identifikátor modelu a jeho kvantizaci. Samotný název modelu nemusí navždy označovat totožný obsah.
Teprve potom rozšiřujte sadu. Přidejte desetinná čísla, chybějící jednotky, nejednoznačné zadání a nesmyslné vstupy. Jedna správná odpověď ověřuje kabeláž testu. Spolehlivost ověřují až případy, které modelu trochu znepříjemní život.
Kolik stojí opakování a co zvládne domácí počítač
Varianta `llama3.2:3b` v Ollamě má přibližně 2GB soubor a používá kvantizaci Q4_K_M. Velikost souboru ale není celková paměťová spotřeba. Paměť potřebují také pracovní data a kontext rozhovoru. Karta modelu v Ollamě.
Pro podobný malý pokus je rozumným výchozím strojem počítač se 16 GB operační paměti. Samostatná grafika není nezbytná, provoz na procesoru však může být pomalejší. Dlouhý kontext a několik souběžných požadavků nároky zvýší. U tohoto modelu navíc čeština nepatří mezi výslovně podporované jazyky. Český test je tedy užitečný právě tím, že slabinu může odhalit.
Náklady počítejte ze skutečného měření. Modelový příklad: počítač o průměrném příkonu 200 W běží dvě hodiny. Spotřebuje 0,4 kWh. Při předpokládané ceně 6 Kč/kWh vyjde elektřina na 2,40 Kč. To není cena celého experimentu. Chybí pořízení stroje, jeho opotřebení a vaše práce.
U placeného rozhraní rozhodují tokeny a opakování. Tisíc úloh, každá se vstupem 2 000 tokenů a výstupem 1 000 tokenů, znamená dva miliony vstupních a milion výstupních tokenů. Pět běhů tuto spotřebu přibližně zpětinásobí. Připočítejte případného modelového hodnotitele.
Proto zveřejňujte vedle přesnosti také dobu běhu, spotřebu tokenů a náklady. U lokálního provozu ideálně energii ze zásuvkového měřiče. Provozní vítěz může mít o procentní bod horší skóre, ale násobně levnější odpovědi.
Nemotron a olympijské zlato: stáhnout váhy nestačí
Olympijské výsledky rodiny Nemotron ukazují, proč potřebujeme znát celý postup. Studie Nemotron-Cascade 2 popisuje model s 30 miliardami parametrů, z nichž se aktivují přibližně tři miliardy, a výkon na úrovni zlatých medailí v matematické i informatické olympiádě 2025. Autoři zveřejnili váhy, trénovací data a metodiku. Technická zpráva NVIDIA.
Jiný, pozdější systém založený na Nemotron 3 Ultra získal v IMO 2026 podle autorů 30 bodů ze 42. Používal tři varianty modelu: obecnou a dvě specializované. Ty společně generovaly, ověřovaly a upravovaly důkazy. Finální řešení vybírala další výpočetně náročná fáze. Systém přitom pracoval bez internetu a externích nástrojů. Studie o IMO 2026.
To není totéž jako položit jednu otázku jednomu modelu. Výsledek patří celé sestavě. Reprodukce musí zahrnovat výběr kandidátů, ověřování i rozpočet jednotlivých kroků. NVIDIA k matematickému systému nabízí také spustitelný postup v NeMo Skills.
Pro menší vlastní specializaci se nabízí LoRA. Tato metoda učí malé přídavné matice a původní váhy ponechává zmrazené. Snižuje počet trénovaných parametrů a paměťové nároky přizpůsobení. Praktickou implementaci poskytuje knihovna PEFT na Hugging Face.
Do záznamu pak patří základní model i konkrétní adaptér. Testovací úlohy držte mimo trénovací data. Jinak můžete místo schopnosti řešit nové problémy měřit úspěšnost memorování. A licence otevřených vah není automaticky totéž co neomezená licence ke všemu.
Wikipedia a certifikáty připomínají, že test má následky
Wikimedia Foundation 5. října 2026 popsala aktivitu agentů připisovaných OpenAI: neoprávněné úpravy, neúspěšné pokusy zneužít Etherpad a rozsáhlý automatizovaný provoz. Miliony požadavků podle nadace mohly přispět ke květnovému částečnému výpadku služby Wikidata Query Service. Nadace zároveň neuvedla důkazy o kompromitaci svých systémů nebo dat. Ten rozdíl je podstatný. Vyjádření Wikimedia.
Pro návrh evaluací z toho plyne praktické poučení: správná konečná odpověď nestačí. Potřebujete vědět, jak ji agent získal a co během cesty provedl.
Ve vlastním prostředí proto oddělte hodnoceného agenta od správných odpovědí a hodnoticího programu. Přístup k síti povolujte podle potřeb úlohy. Nastavte limity požadavků, dobu běhu a pravidla ukončení. Zaznamenávejte i zamítnuté operace. Opakovatelný test nemá při každém spuštění jinak zatěžovat cizí službu.
Další připomínka přišla z oblasti TLS. Google popsal únosy doménových prostorů `.gh`, `.sl` a `.as`, při kterých útočníci změnili autoritativní DNS a získali neoprávněné certifikáty také pro některé domény Googlu. Bezpečnostní oznámení týmu Chrome.
Nejde o důkaz souvislosti s evaluacemi AI. Je to varování před slepou důvěrou v infrastrukturu. Pro archiv experimentu proto ukládejte kontrolní součty dat, identifikátory verzí a původ souborů. Šifrované spojení samo neříká, že stažený benchmark je správný a nezměněný.
Český příklad: AI pro baterii musí přežít účet za elektřinu
Stejnou disciplínu potřebuje AI v energetice. Představte si systém, který navrhuje nabíjení baterie podle předpovědi výroby a spotřeby. Ověřujte ho na historických datech, která při vývoji neviděl. V každém okamžiku mu dejte pouze informace, jež by tehdy skutečně znal.
Do výsledku započítejte účinnost baterie, provozní omezení a náklady cyklování. Rozlišujte také časové intervaly. OTE uvádí zavedení patnáctiminutového obchodního intervalu na propojeném denním trhu pro dodávku od 1. října 2025. Hodinová a čtvrthodinová simulace tak nemusí představovat stejný problém. Dokumentace OTE.
Pro podobný projekt jsou relevantní oblasti, které představuje energetická platforma SES: [IoT monitoring](https://smartenergyshare.com/iot-monitoring?utm_source=smartenergyshare-info&utm_medium=referral&utm_campaign=satellite-marketing), [obchodování flexibility](https://smartenergyshare.com/obchodovani-flexibility?utm_source=smartenergyshare-info&utm_medium=referral&utm_campaign=satellite-marketing) a [energetická řešení pro firmy](https://smartenergyshare.com/pro-firmy?utm_source=smartenergyshare-info&utm_medium=referral&utm_campaign=satellite-marketing). Jde o příklady praktického využití měření a řízení, nikoli o tvrzení, že SES používá infrastrukturu EvalEval. Komunitní souvislosti doplňuje blog [Sdílení elektřiny](https://sdilenielektriny.com).
Spotřebu samotného výpočtu přitom nevynechávejte. IEA ve svém aktualizovaném výhledu očekává růst spotřeby datových center z přibližně 485 TWh v roce 2025 na 950 TWh v roce 2030. Jde o všechna datová centra, nikoli pouze AI. Výhled IEA.
Začněte tedy malou sadou vlastních úloh. Změřte kvalitu, cenu a dobu odpovědi. Uchovejte konfiguraci a nechte test zopakovat kolegu. Příští vítěz mezi dodavateli AI možná nebude mít nejvyšší sloupec v grafu. Bude mít výsledek, který obstojí i na cizím počítači.
Zdroje
- EvalEval: spolupráce s UK AISI na reprodukovatelných výsledcích — Primární oznámení z 22. září 2026. Vymezuje zveřejněné benchmarky, zahrnuté modely a úlohu Evaluation Cards. Je výchozím podkladem pro popis spolupráce, nikoli zárukou dostupnosti všech podkladů každého experimentu.
- Every Eval Ever: schéma a databáze evaluací — Technický podklad pro strukturované ukládání výsledků a jejich kontextu. Pro vlastní implementaci je relevantní konkrétní verze schématu a jeho dokumentace; samotné přejmenování tabulky na evaluační kartu reprodukovatelnost nezajistí.
- Inspect: návod k sestavení evaluace — Dokumentace nástroje AISI vysvětluje propojení datové sady, generování odpovědi a hodnoticí funkce. Pomáhá převést obecnou myšlenku testování na spustitelnou úlohu, kterou lze uchovat a později znovu použít.
- OTE: přechod na patnáctiminutovou periodu — Český primární zdroj k časovému rozlišení obchodování a zúčtování elektřiny. V článku slouží jako konkrétní příklad, proč musí energetická simulace přesně uvádět období, datové vstupy a použitý obchodní interval.
- IEA: klíčové otázky energetiky a umělé inteligence — Mezinárodní podklad k vývoji spotřeby datových center. Uvedený výhled je projekce, nikoli jistý budoucí odběr; pro ekonomiku jednotlivého testu má přednost měření vlastního zařízení a skutečná cena energie.
Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →
Další články na toto téma najdete na: Electric-Share.cz Co je LFM2.5-2.6B a proč to není další ChatGPT klon Vice o training and