Pavel Gloss

Pavel Gloss je AI konzultant a architekt AI řešení se software engineering backgroundem. 

V České spořitelně vedl rozvoj konverzační AI HeyGeorge pro přibližně 2 miliony klientů. 

Dnes pomáhá firmám navrhovat a stavět AI produkty i zavádět AI do firemních procesů — od agentic workflow a RAG systémů po orchestraci AI agentů a spolehlivou evaluaci LLM systémů tak, aby AI přinášela reálnou byznysovou hodnotu.

Evaluace spolehlivosti LLM agentů při technických úlohách

Evaluujeme konkrétní agentickou konfiguraci pomocí nástrojů jako Terminal-Bench 2.0 a Harbor. Konfigurací může být například Terminus 2 + konkrétní LLM model, nebo Claude Code CLI + konkrétní model — podle toho, jestli chceme neutrálnější benchmark modelu, nebo test blízký reálnému produkčnímu použití. Cílem je zjistit, jak spolehlivě LLM-driven agent zvládne technický úkol v terminálu — například převod PDF do textu, obohacení produktového CSV nebo vytvoření databáze s transakcemi. Agent pracuje nad danými vstupními daty, nástroji a konfigurací prostředí; úspěch měří deterministické testy proti očekávanému výsledku, zatímco opakované běhy ukazují míru nespolehlivosti způsobenou stochastickým chováním modelu a agentické exekuce.

ČERNÁ STAGE

17:00–17:12

Program

Sdílet odkaz na speakera

Načítám adresu...