← Všechny články
Srovnání dvou variant: jedna označená křížkem, druhá zaškrtnutímVarianta AVarianta B

Pod kapotou

Umí open-source AI dobře česky? Otestovali jsme pět modelů na firemní práci

DoneBy tým··9 min čtení

Umí open-source AI dobře česky? Otestovali jsme pět modelů na firemní práci#

Otestovali jsme pět open-source AI modelů na 147 reálných firemních úkolech v češtině. Výsledek nás překvapil: správně vybraný open-source model zvládá českou firemní komunikaci slušně, odolá pokusům o zneužití a stojí zlomek ceny špičkových komerčních modelů. Záleží ale na verzi — starší generace si vymýšlela, nová ne.

Shrnutí

  • Testovali jsme pět open-source modelů na 147 reálných firemních úkolech, ne na pár ukázkách
  • Nejlépe dopadla Gemma 4 31B: zvládla 95 ze 147 úkolů, tedy 65 %
  • Čeština vyšla na 3,5 až 3,9 z 5 — slušně, ne dokonale
  • Bezpečnost: všechny aktuální modely odolaly pokusům o zneužití
  • Na malém testu vyhrával jiný model než na velkém, proto rychlým srovnáním nevěřte

Co je open-source AI a proč jsme ji testovali#

Open-source AI model je program, jehož „mozek" je veřejně dostupný. Nemusíte ho jen draze pronajímat od jedné firmy jako ChatGPT nebo Claude — k rozdílu mezi napojeným ChatGPT a nativním AI systémem máme samostatný článek. Můžete ho provozovat na svém, vybrat si, kde poběží, a platit jen za to, co reálně zpracuje.

Pro českou firmu to má dvě praktické výhody. Je to výrazně levnější a máte větší kontrolu nad tím, kde leží vaše data. Háček je v tom, že open-source modelů existují desítky a kvalita se liší propastně. Někdy stejná „rodina" modelů funguje skvěle v nové verzi a tragicky ve staré.

Nechtěli jsme se spoléhat na cizí marketing ani na zahraniční žebříčky postavené na angličtině. Postavili jsme proto vlastní test na reálné firemní práci v češtině. Tady jsou výsledky a šest věcí, které nás na nich nejvíc zaujaly.

Jak jsme open-source AI vlastně testovali?#

Vzali jsme pět open-source modelů a nechali je odpracovat 147 reálných firemních úkolů rozdělených do 18 oblastí. Od péče o kontakty přes úlohy s číselnou a finanční logikou až po vícekolové konverzace s klientem a bezpečnostní situace.

Test měl dvě fáze. V první prošel každý model všech 147 úkolů a u každého jsme jasně změřili, jestli dopadl správně, nebo ne. Ve druhé fázi jsme samostatně a podrobně hodnotili kvalitu češtiny, kterou modely produkují.

Důležitý detail je férovost. Mezi každým modelem jsme databázi vrátili do stejného výchozího stavu. Bez toho by si modely navzájem „špinily" výsledky — jeden by uklidil nepořádek po druhém a čísla by byla k ničemu.

Info

Slovo benchmark znamená srovnávací test. V AI světě se jím porovnává, jak si různé modely vedou na stejné sadě úkolů. Většina veřejných benchmarků měří angličtinu a obecné znalosti. My jsme chtěli vědět něco jiného: jak model zvládne českou firemní práci, ne kvíz z dějepisu.

Jak modely dopadly?#

Nejlépe si vedla Gemma 4 ve své velké variantě. Zvládla 95 ze 147 úkolů. Tři aktuální modely byly blízko u sebe, jeden starší výrazně propadl. Tady je celkové pořadí.

PořadíModelÚspěšnost (ze 147)Čeština (z 5)
1.Gemma 4 31B95 (65 %)3,5
2.Qwen3.6 (~27B)89 (61 %)3,7
3.Gemma 4 26B86 (59 %)3,9
Gemma 3 27B (starší)34 (23 %)0,6
Počet zvládnutých úkolů ze 147

Co znamená to „31B" nebo „26B" za názvem? Je to zhruba velikost modelu, tedy kolik „mozkových buněk" má k dispozici. Větší číslo neznamená automaticky lepší výsledek, jak ukazuje hned první z našich zjištění.

Proč malý test klame a velký rozhoduje#

Kdybychom test ukončili po prvních čtrnácti úkolech, vybrali bychom špatně. Na malém vzorku vyhrávala menší Gemma 4 26B. Jakmile jsme dohnali test do plných 147 úkolů, pořadí se otočilo a navrch získala větší Gemma 4 31B.

Tohle je nejdůležitější praktické poučení z celého testu. Krátké srovnání na pár příkladech vám ukáže náhodu, ne skutečnost. Stačí, aby se mezi prvními úkoly sešly zrovna ty, které jednomu modelu sedí, a žebříček je vzhůru nohama.

Pozor

Když uvidíte v reklamě nebo na konferenci „náš model porazil konkurenci", ptejte se na kolika úkolech. Jestli na deseti, je to orientační číslo, ne důkaz. Rozdíly mezi modely se spolehlivě projeví až na stovkách různorodých situací.

Stará AI si vymýšlí, nová ne#

Největší propast nebyla mezi značkami, ale mezi generacemi téhož modelu. Starší Gemma 3 dostala za češtinu 0,6 z 5. Novější Gemma 4 skočila na 3,5 až 3,9. To není drobné zlepšení, to je jiná liga.

Starší model totiž halucinoval. Halucinace je odborný výraz pro situaci, kdy si AI vymýšlí. Tváří se naprosto sebejistě, ale obsah je nesmysl. Odpoví vám faktem, který nikdy neexistoval, a nedá na sobě znát, že nemá tušení.

Poučení pro firmu je jasné. „Open-source AI" není jeden produkt, který buď funguje, nebo ne. Je to desítky modelů různého stáří a kvality. Vzít náhodný model, protože je zadarmo, je risk. Rozdíl mezi verzí z loňska a letoška může být rozdíl mezi nepoužitelným a spolehlivým nástrojem.

Potřebujete systém na míru?

Ukážeme vám, jak DoneBy řeší přesně tohle. Bez závazku.

Domluvit seznámení

Umí open-source AI česky?#

Ano, slušně. Ne dokonale. Nejlepší modely se pohybovaly mezi 3,5 a 3,9 z 5 za kvalitu češtiny. To je úroveň, na které model napíše srozumitelnou, gramaticky v pořádku znějící odpověď klientovi, ale občas zaškobrtne na skloňování nebo zvolí kostrbatější formulaci.

Tím padá rozšířený mýtus, že umělá inteligence umí pořádně jen anglicky. Správně vybraný open-source model dnes českou firemní komunikaci zvládá. Nečekejte styl rodilého copywritera, čekejte spolehlivého úředníka, který napíše věc jasně a bez ostudy.

Buďme poctiví k limitům. Hodnocení češtiny vychází z menšího vzorku, takže ho berte jako silný náznak, ne jako absolutní jistotu. Pro běžnou firemní práci ale platí jednoduchý závěr: čeština už není důvod, proč AI ve firmě odkládat.

Je open-source AI bezpečná?#

V našem testu výjimečně. Na bezpečnostních úkolech, kde jsme se modely snažili přimět obejít pravidla nebo vyzradit něco, co měly držet pod pokličkou, neselhal ani jeden aktuální model. Plný počet bodů napříč celou trojicí.

Tohle je důležité, protože kolem open-source AI koluje obava, že „když je to zadarmo a veřejné, bude to děravé". V praxi se nepotvrdila. Bezpečnost modelu nesouvisí s tím, jestli za něj platíte, ale s tím, jak je vytrénovaný a jak je zasazený do okolního systému.

Tip

Bezpečnost u firemní AI nestojí jen na modelu. Stojí hlavně na pravidlech kolem něj — kdo se na co smí ptát, ke kterým datům má přístup a co systém vůbec dovolí vykonat. Dobře postavený systém udrží i obyčejný model na uzdě.

Proč jsou dva podobné modely jinak dobré#

Dva nejlepší modely se lišily v tom, v čem vynikají, a důvod je v jejich vnitřní stavbě. Tady se hodí dva pojmy.

U takzvaného dense modelu pracuje na každém slově celý model najednou. Je důkladnější, ale náročnější na provoz. Tak funguje vítězná Gemma 4 31B.

MoE, zkratka pro Mixture of Experts neboli „směs expertů", zapojí jen tu část modelu, která se na daný úkol hodí. Je rychlejší a levnější, protože nepoužívá celý mozek na každé slovo. Tak funguje Gemma 4 26B.

V praxi se to projevilo přesně podle očekávání. Důkladnější dense model vedl na složitějších úlohách s číselnou a finanční logikou, kde zvládl 8 ze 16 oproti 4 ze 16 u svého lehčího kolegy, a byl lepší ve vícekolových konverzacích. Lehčí MoE model měl naopak nejhezčí češtinu a na běžných úkolech se plně vyrovnal.

Závěr není „tento je nejlepší". Závěr je, že výběr modelu je kompromis podle toho, co firma nejvíc potřebuje. Hodně náročných výpočtů a dlouhých konverzací? Spíš dense. Hlavně příjemná čeština za nižší cenu? Spíš MoE.

Kolik to stojí a proč na konkrétním modelu tolik nezáleží#

Open-source modely se platí za skutečně zpracovaný text, ne paušálem. Platíte tedy jen za to, co model opravdu odpracuje. Proti špičkovým komerčním modelům je to řádově levnější, a přitom kvalita zůstává konkurenceschopná. Pro firmu, která hlídá náklady, je to zásadní rozdíl — kolik vlastně takový AI systém stojí, jsme rozebrali samostatně.

Ještě důležitější je ale jiná věc. Konkrétní model je dnes komodita, která se rychle mění. Nový AI model jsme do našeho systému zapojili za pár hodin. Pro firmu to znamená, že nejste zamčení u jednoho dodavatele. Přijde lepší, levnější nebo bezpečnější model? Přepneme na něj, aniž to ve své práci pocítíte.

Tady je skrytá pointa celého testování. Rozhodování, který model použít, kde ho provozovat a jak ošetřit vaše data, je složité a každý měsíc se mění. Smysl dobře postaveného firemního systému je v tom, že tohle řešit nemusíte. Vybere se za vás to nejlepší pro váš rozpočet a vaše požadavky, a vy dostanete nástroj, který prostě funguje.

Většina dodavatelů AI vám řekne „máme nejlepší model". My vám místo toho ukazujeme čísla z reálného testu — i tam, kde nevyšla dokonale. Pro konzervativní českou firmu je doložená poctivost spolehlivější základ než hezky znějící sliby.

Často kladené otázky#

Umí open-source AI dobře česky?#

Slušně, ne dokonale. V našem testu dosáhly nejlepší modely (Gemma 4 a Qwen3.6) hodnocení 3,5 až 3,9 z 5 za kvalitu češtiny. Správně vybraný open-source model zvládne českou firemní komunikaci na použitelné úrovni. Mýtus, že AI umí pořádně jen anglicky, dnes neplatí — záleží ale hodně na konkrétní verzi modelu.

Je open-source AI bezpečná pro firmu?#

V našem testu ano. Na bezpečnostních scénářích, kde jsme se modely pokoušeli přimět obejít pravidla nebo vytáhnout informace, které neměly vydat, neselhal ani jeden aktuální model. Plný počet bodů. Představa, že open-source znamená automaticky děravé a nebezpečné, se v praxi nepotvrdila.

Vyplatí se open-source AI oproti komerčním modelům jako ChatGPT nebo Claude?#

Pro firmu citlivou na náklady často ano. Open-source modely se platí za skutečně zpracovaný text a jsou řádově levnější než špičkové komerční modely. Náš nejlepší open-source model přitom odváděl konkurenceschopnou práci. Pro běžnou firemní práci v češtině je to silný argument.

Proč nevěřit AI testům na pár příkladech?#

Protože malý vzorek klame. Na 14 úkolech nám vyhrával jiný model než na plných 147 úkolech — pořadí se otočilo. Kdybychom se rozhodli podle rychlého testu, vybrali bychom hůř. Krátké srovnávací testy z reklam berte jako orientační, ne jako pravdu.

Zjistit, jestli si sedneme#

Tahle čísla nejsou samoúčelná. Stojí za nimi rozhodnutí, jakou AI nasadíme do firemního systému, který za naše klienty reálně dělá práci. Vybíráme model, hlídáme češtinu, řešíme bezpečnost i to, kde leží vaše data, a vy se o nic z toho nestaráte.

Pokud zvažujete AI pro svou firmu a chcete vědět, jestli by vám náš přístup sedl, ozvěte se. První krok je nezávazný hovor, ne registrace.

Zjistit, jestli si sedneme →