Čmejrek z Mama AI finženám: Umělá inteligence od nás má to dobré i to špatné
Doba, kdy umělá inteligence předkládá zjevné nesmysly, bude brzy minulostí. Složitější to bude s odstraněním nejrůznějších zkreslení v jejích výstupech. Která jsou ta nejčastější a nejnebezpečnější? Nejen to bylo náplní setkání podkomunity Risk & Compliance projektu #FinŽeny, v rámci nějž vystoupil spoluzakladatel Mama AI Martin Čmejrek. Akce se uskutečnila v prostorách pojišťovny Kooperativa, která je partnerem podkomunity.

Tématem setkání s názvem AI a bias byla rizika a předsudečná zkreslení spojená s umělou inteligencí. Čmejrek svůj příspěvek postavil na příkladech sedmi „průšvihů“, na nichž ilustroval svou hlavní myšlenku, že i svá zkreslení nástroje umělé inteligence kopírují od lidí a jimi poskytnutých dat.
„Spusťte na svých telefonech svého oblíbeného umělého inteligenta a dejte mu pokyn, ať uvede libovolné číslo mezi jedničkou a desítkou,“ vyzval Čmejrek publikum. Po chvilce všichni posluchači potvrdili, že na displejích vidí sedmičku. Podle Čmejrka je to tím, že k témuž číslu tíhnou i lidé, kteří si jej podle řady průzkumů vybírají setrvale zhruba v 30 procentech případů. „Například Chat GPT ten efekt ještě zesílí a vybere sedmičku v 55 procentech případů,“ dodal řečník. „Proč je to tak deterministické? Protože neuronová síť je nakrmená našimi daty,“ pokračoval. Má-li jít tedy o skutečnou „náhodu“, nelze na odpovědi neuronových sítí plně spoléhat, protože modely reflektují a zesilují distribuční zkreslení, které získaly z trénovacích dat.
Druhý bod se týkal vektorové reprezentace, tedy konceptů, s nimiž neuronové sítě pracují. V systémech se uchovávají jako body v určitých sémanticky příbuzných klastrech. „Je to velmi silný koncept, který má v průmyslu dobré využití,“ uvedl Čmejrek. „Háček je v tom, že model sice vytáhne vazby mezi koncepty tak, jak si je představujeme a jak jim rozumíme, současně ale také prezentuje stereotypy, které v datech jsou, ale my nechceme, aby s nimi pracoval,“ vysvětlil.
Další problematickou podmnožinou jsou proxy zkreslení. Pro příklad Čmejrek sáhl do oblasti zdravotnictví. Zmínil hypotetický zdravotnický program, do nějž má model vybrat omezenou skupinu pacientů. Jelikož je ale trénovaný na datech týkajících se nákladnosti léčby místo šance na vyléčení daných pacientů, dodá zkreslené výsledky. „Daná skupina pak vykáže nemocnost 45 procent místo reálných 17, což pramení z použití dat získaných ze socioekonomického statusu těch lidí,“ pokračoval Čmejrek s tím, že takto model může například diskriminovat černochy ve prospěch bělochů. Je tedy třeba vždy hlídat, jaká data se poměřují.
U čtvrtého bodu speaker varoval před zkreslením, jež vzniká z historických dat. Zmínil příklad Amazonu, který musel zrušit svůj AI systém pro vytěžování životopisů, protože diskriminoval ženy. .„V historických datech, které do systému vložili, aby se z nich systém učil, nebyly ženy dostatečně zastoupeny,“ přiblížil Čmejrek. Systém se učil i z nežádoucích datových dimenzí, jako jsou typ škol, geografie, gramatický styl či kariérní přestávky. A protože měly ženy v technických rolích nižší zastoupení, automaticky je vyhodnotil jako méně vhodné než muže, ačkoli ve výše uvedených kritériích měly stejné výsledky.
„Dnes je práh pro pořízení takových aplikací velice nízko. Každá firma si ji může implementovat či napsat. Vystavuje se ale riziku, že tam bude mít historické zkreslení. Ale my se chceme posunout, nikoli replikovat minulost i s chybami,“ dodal Čmejrek.
Dále se hosté dozvěděli více o zkreslení automatizace, s nímž úzce souvisí selhání lidské kontroly, optimalizaci nesprávně zvoleného cíle a celém komplexu otázek kolem autonomie AI. Závěrem Čmejrek připomněl, že mnohé potíže nepramení z chyb AI, ale z chybného zadání špatně promyšlených cílů. „Pro člověka zbývá hodně práce v hlídání umělé inteligence,” uzavřel.