Kapitola 6.1**: Statistické zpracování dat a umělá inteligence
Co se naučíš: V této kapitole se seznámíš se základy statistického zpracování dat, strojovým učením a umělou inteligencí. Pochopíš, jak AI funguje, jaké má přínosy a jaká rizika přináší.
1. Statistické zpracování dat
Statistika nám pomáhá porozumět datům a dělat na jejich základě rozhodnutí.
Základní statistické pojmy
Průměr (Mean): Součet hodnot dělený jejich počtem.
Medián: Prostřední hodnota v seřazených datech.
Modus: Nejčastěji se vyskytující hodnota.
Směrodatná odchylka: Měří rozptyl dat od průměru.
Korelace: Míra vztahu mezi dvěma proměnnými (-1 až +1).
Příklad: Známky ze zkoušky: 1, 2, 2, 3, 2, 4, 1, 2, 3, 5 Průměr: (1+2+2+3+2+4+1+2+3+5) / 10 = 2,5 Medián: 2 (prostřední hodnota po seřazení) Modus: 2 (vyskytuje se 4×)
Vizualizace dat
Sloupcový graf: Porovnání kategorií.
Koláčový graf: Podíly celku.
Spojnicový graf: Vývoj v čase.
Bodový graf (Scatter): Vztah mezi dvěma proměnnými.
Histogram: Rozložení hodnot.
2. Co je umělá inteligence?
Umělá inteligence (AI) je schopnost počítačových systémů vykonávat úkoly, které normálně vyžadují lidskou inteligenci.
Typy AI:
Úzká AI (Narrow AI): Specializovaná na jeden úkol (rozpoznávání obrázků, překlad). To je dnešní AI.
Obecná AI (AGI): Hypotetická AI s lidskou úrovní inteligence. Zatím neexistuje.
Strojové učení (Machine Learning)
Strojové učení je podoblast AI, kde se systémy "učí" z dat místo toho, aby byly explicitně naprogramovány.
Typy strojového učení
Supervised Learning (s učitelem): Model se učí z příkladů s "správnými odpověďmi". Např. rozpoznávání spamu.
Unsupervised Learning (bez učitele): Model hledá vzory v datech. Např. segmentace zákazníků.
Reinforcement Learning (posilované učení): Model se učí metodou pokus-omyl s odměnami. Např. hry, robotika.
UML diagramy - standardní notace pro modelování
Jak funguje strojové učení?
Sběr dat: Potřebujeme velké množství kvalitních dat.
Příprava dat: Čištění, transformace, rozdělení na trénovací a testovací.
Trénování modelu: Algoritmus hledá vzory v trénovacích datech.
Evaluace: Testování na nových datech, měření přesnosti.
Zpracování jazyka (NLP): Překlad, chatboti, asistenti (Siri, Alexa).
Doporučovací systémy: Netflix, Spotify, e-shopy.
Generativní AI: ChatGPT, DALL-E, Midjourney.
Zdravotnictví: Diagnostika z rentgenů, predikce nemocí.
4. Limity a rizika AI
⚠️ Důležité – AI má své limity!
Závisí na datech: Špatná data = špatné výsledky (GIGO).
Bias (předpojatost): AI přebírá předsudky z trénovacích dat.
Black box: Nevíme přesně, proč AI udělala dané rozhodnutí.
Halucinace: Generativní AI může "vymýšlet" neexistující fakta.
Etické otázky
Kdo je odpovědný za chyby AI?
Jak zajistit soukromí dat?
Nahradí AI lidská pracovní místa?
Jak zabránit zneužití (deepfakes, dezinformace)?
Sekvenční diagram - komunikace mezi objekty
Člověk a digitální svět
Umělá inteligence mění svět kolem nás. Je důležité rozumět tomu, jak funguje, abychom ji mohli používat zodpovědně a kriticky hodnotit její výstupy. AI je nástroj – záleží na nás, jak ho použijeme.
Use case diagram - případy užití systému
** Úkoly pro maturitní obory
Excel – Statistická analýza: Stáhni dataset (např. z Kaggle). Vypočítej: průměr, medián, modus, směrodatnou odchylku. Vytvoř 3 různé typy grafů. Napiš krátkou analýzu (co data ukazují).
PowerPoint – Prezentace o AI: Vytvoř prezentaci "Umělá inteligence kolem nás" (12-15 snímků). Zahrň: co je AI, typy, příklady, přínosy, rizika, budoucnost.
Word – Etická analýza: Napiš esej "Etické otázky umělé inteligence" (2-3 strany). Vyber si jedno téma (bias, soukromí, práce) a rozeber ho z různých úhlů pohledu.
Canva – Infografika: Vytvoř v Canvě infografiku "Jak funguje strojové učení" pro laiky. Použij jednoduché ikony a krátké texty. Vysvětli 5 kroků procesu.
Praktické vyzkoušení AI: Vyzkoušej různé AI nástroje: ChatGPT (text), DALL-E nebo Midjourney (obrázky), DeepL (překlad). Napiš recenzi: co umí, co ne, kde dělá chyby.
Excel – Korelace: Vytvoř tabulku s dvěma proměnnými (např. hodiny studia vs známka). Vypočítej korelaci pomocí =CORREL(). Vytvoř bodový graf. Vyvoď závěry.
*** Rozšíření pro IT obory
Jako budoucí IT specialista musíš rozumět statistice a základům strojového učení na teoretické úrovni. Tato kapitola rozšiřuje pochopení bez programování.
Statistické pojmy pro IT
Pojem
Definice
Použití v IT
Průměr (Mean)
Součet hodnot / počet hodnot
Průměrná doba odezvy serveru
Medián
Prostřední hodnota seřazených dat
Odolnější vůči outlierům
Směrodatná odchylka
Míra rozptylu dat od průměru
Stabilita výkonu systému
Percentil
Hodnota, pod kterou je X% dat
P99 latence (99% požadavků rychlejších)
Korelace
Síla vztahu mezi dvěma proměnnými
Vztah mezi zatížením a odezvou
Typy dat v machine learning
Typ dat
Popis
Příklady
Numerická spojitá
Libovolná čísla v rozsahu
Teplota, cena, věk
Numerická diskrétní
Celá čísla, počty
Počet dětí, počet kliknutí
Kategorická nominální
Kategorie bez pořadí
Barva, město, pohlaví
Kategorická ordinální
Kategorie s pořadím
Vzdělání, hodnocení (1-5)
Proces strojového učení
Typický workflow ML projektu:
Sběr dat: Získání relevantních dat (databáze, API, scraping).
Typy dat: Pro dataset e-shopu (zákazníci, produkty, objednávky) urči typ každé proměnné: jméno, věk, město, celková útrata, počet objednávek, preferovaná kategorie.
ML workflow: Vyber si problém (např. predikce ceny domu) a popiš, jak bys postupoval v každé fázi ML workflow.
Algoritmy: Pro každý případ vyber vhodný algoritmus: a) predikce ceny akcií, b) rozpoznání rukou psaných číslic, c) seskupení zákazníků podle chování.
Bias v AI: Najdi reálný příklad, kdy AI systém vykazoval bias (předpojatost). Popiš: co se stalo, proč, jak se to dalo předejít.