# Boardroom AI Monitor — metodyka (wersja 0.3) **Data wersji:** 2026-08-12 (v0.3; historia zmian: §10) · **Edycja danych:** E1-2026 · **Autor:** Andrzej Chądzyński Boardroom AI Monitor mierzy, **jak często i w jakim kontekście zarządy spółek giełdowych mówią publicznie o sztucznej inteligencji** — na podstawie wyłącznie publicznych dokumentów korporacyjnych. To **monitor/sygnał, nie indeks ani benchmark**: próba jest mała i dobrana celowo, a wyniki należy czytać jako wskaźnik kierunkowy, nie ranking jakości zarządzania. --- ## 1. Próba (Edycja 1: N=10) Dobór celowy: 5 spółek z indeksu **DAX** i 5 z indeksu **WIG20**, z przybliżonym parowaniem sektorowym DE↔PL, tak by porównanie krajów nie było w całości artefaktem struktury sektorowej: | Sektor (ok.) | DAX | WIG20 | |---|---|---| | finanse | Allianz SE | PKO Bank Polski S.A. | | oprogramowanie | SAP SE | CD PROJEKT S.A. | | przemysł / surowce | BASF SE | KGHM Polska Miedź S.A. | | przemysł / energia | Siemens AG | ORLEN S.A. | | usługi cyfrowe | Deutsche Telekom AG | Allegro.eu S.A. | Parowanie jest przybliżone (np. SAP↔CD Projekt to inne skale i modele biznesowe) i służy wyłącznie ograniczeniu skrzywienia sektorowego, nie porównaniom 1:1. ## 2. Wykluczenia (konflikt interesów) **Z próby trwale wykluczeni są producenci dźwigów i schodów ruchomych** — w szczególności KONE, Otis, Schindler i TK Elevator oraz każda spółka, której istotna część działalności przypada na tę branżę. Powód: **konflikt interesów autora, który zawodowo pracuje w tej branży**. Wykluczenie obowiązuje we wszystkich edycjach i nie podlega wyjątkom; jest podawane w każdej publikacji wyników. ## 3. Korpus - **Typ dokumentu (E1):** raport roczny za rok obrotowy 2025 — dla spółek niemieckich pełny *Geschäftsbericht* / raport zintegrowany, dla polskich preferencyjnie *Sprawozdanie Zarządu z działalności* (część opisowa raportu rocznego), a gdy niedostępne osobno — pełny raport roczny. - **Porównywalność:** metryki porównujemy **wyłącznie w ramach tego samego typu dokumentu**. Nie mieszamy raportów rocznych z listami do akcjonariuszy ani transkryptami w jednej metryce. - **Jedna wersja językowa na dokument** (deduplikacja wydań dwujęzycznych), z preferencją języka lokalnego: DE dla spółek niemieckich, PL dla polskich. Nota: dla Allegro.eu (inkorporacja w Luksemburgu) wersją wiążącą jest angielska; analizowane jest oficjalne polskie tłumaczenie opublikowane na stronie IR spółki — dla spójności językowej kohorty PL. - **Źródła: wyłącznie oficjalne, publiczne strony relacji inwestorskich.** Żadnych agregatorów płatnych, żadnej redystrybucji pełnych tekstów. - **Okres źródłowy:** rok obrotowy 2025. Uwaga: rok obrotowy Siemensa kończy się 30 września 2025 (raport z grudnia 2025), pozostałe spółki raportują za rok kalendarzowy 2025 (raporty z lutego–kwietnia 2026). Edycja publikowana poza sezonem raportowym jawnie wskazuje okres źródłowy. - Transkrypty earnings calls **nie wchodzą** do korpusu E1 (będą rozważane tylko tam, gdzie spółka publikuje je oficjalnie i bez paywalla). ## 4. Słownik terminów i zliczanie - Słownik wielojęzyczny (EN/DE/PL) w pliku `terms.yaml` (wersjonowany); obejmuje m.in.: *AI, artificial intelligence, KI, künstliche Intelligenz, sztuczna inteligencja (z odmianą), machine learning, maschinelles Lernen, uczenie maszynowe, generative AI/KI, GenAI, LLM, large language model, duży model językowy, großes Sprachmodell, deep learning, foundation model*. - Dopasowanie na **granicach słów**; skróty (AI, KI, LLM, GenAI) dopasowywane **z uwzględnieniem wielkości liter**, aby uniknąć fałszywych trafień. - Trafienia **nakładające się liczone są raz** — wygrywa dłuższe dopasowanie („generative AI" = 1 wzmianka, nie 2). - **Reguły przeciw fałszywym trafieniom (słownik v0.2, wynik audytu E1):** (a) „KI" dopasowywane wyłącznie w dokumentach niemieckojęzycznych — w polskich PDF-ach ozdobne nagłówki stron ekstrahują się jako rozsypane litery (np. „WYNIKI" → „…KI WE"), co generowało setki pozornych wzmianek; (b) „LLM" z wykluczeniem kontekstu akademickiego (LLM = również tytuł prawniczy *Master of Laws*). Wykluczenia kontekstowe są logowane i audytowalne. - **Normalizacja:** liczba wzmianek na 1000 słów dokumentu. Liczba słów = tokeny rozdzielone białymi znakami po ekstrakcji tekstu z PDF/HTML. - Ograniczenie: analizowany jest **cały dokument**, łącznie z częścią finansową, spisem treści i notami — rozwadnia to wskaźnik częstości w długich raportach; wpływ jest jednak zbliżony w ramach tego samego typu dokumentu. ## 5. Klasyfikacja kontekstu wzmianek Każda wzmianka (kontekst ±2 zdania) klasyfikowana jest do **jednej** z klas: | Klasa | Znaczenie | |---|---| | **REVENUE** | przychody/wzrost: produkty i usługi oparte na AI, oferta dla klientów, monetyzacja | | **COST** | koszty/efektywność: automatyzacja, produktywność, oszczędności, procesy wewnętrzne | | **RISK** | ryzyko/regulacje: ryzyka AI, AI Act, compliance, cyberbezpieczeństwo, etyka | | **TALENT** | ludzie/kompetencje: szkolenia, rekrutacja, upskilling, kultura pracy | | **VAGUE** | frazes: deklaracja bez konkretu (bez liczby, projektu, produktu, rezultatu) | Dodatkowo flaga **substance** (tak/nie): czy wzmianka zawiera liczbę, nazwę projektu/produktu lub konkretny rezultat. Udział wzmianek „z konkretem" to **substance ratio**. - Klasyfikację wykonuje model językowy (skrypt `classify.py`); **każda wzmianka zachowuje krótki cytat (≤25 słów), numer strony i URL dokumentu** — pełna audytowalność w `data/dataset.json`. - Przy dokumentach z bardzo dużą liczbą wzmianek klasyfikowana może być **próbka systematyczna (co k-ta wzmianka, min. 40 na dokument)**; częstość wzmianek liczona jest zawsze na pełnym tekście, a struktura klas — na próbce. Fakt próbkowania jest odnotowany w danych. - **Przegląd ręczny:** przed publikacją człowiek weryfikuje losowe ≥10% sklasyfikowanych wzmianek (plik `output/przeglad-probki.md`). - W Edycji 1 klasyfikację wykonał model Claude (Anthropic); lista wzmianek do przeglądu ręcznego czeka na weryfikację autora przed jakąkolwiek publikacją. ## 5a. Test odporności (obowiązkowy element edycji) Przy małej próbie pojedyncza spółka lub wybór estymatora potrafi zmienić wynik kilkukrotnie. Dlatego **każda edycja przechodzi test odporności** (`sensitivity.py`, publikowany razem z raportem jako `output/analiza-wrazliwosci-.md`): 1. **Zmiana estymatora** — ten sam stosunek liczony przez medianę, średnią, średnią geometryczną i łącznie (wzmianki/słowa). 2. **Leave-one-out** — przeliczenie po usunięciu każdej spółki po kolei. 3. **Stratyfikacja po typie dokumentu** — czy twierdzenie utrzymuje się osobno w każdej warstwie. **Liczbą-nagłówkiem edycji może zostać wyłącznie twierdzenie, które przejdzie te testy.** W Edycji 1 doprowadziło to do degradacji porównania DAX↔WIG20 (przedział 1,5×–4,1×) i wysunięcia na pierwszy plan gradientu sektorowego, który utrzymuje się w obu typach dokumentów. Raport nie powstaje, jeśli test odporności nie został wykonany (`report.py` przerywa działanie). ## 6. Audytowalność - `data/dataset.json`: każda wzmianka z cytatem, klasą, flagą substance, numerem strony i URL-em źródła; każdy dokument z sumą kontrolną SHA-256. - Kod pipeline'u, słownik i metodyka wersjonowane w repozytorium git — historia zmian stanowi ścieżkę audytu. - Ton raportu jest opisowy, nie oceniający: „mówi rzadko" ≠ „jest w tyle". ## 7. Ograniczenia (czytaj przed cytowaniem) 1. **N=10 — to sygnał, nie benchmark.** Wyniki nie uogólniają się na całe indeksy ani gospodarki. 2. Dobór celowy spółek (największe/najbardziej rozpoznawalne) zawyża zapewne widoczność AI względem przeciętnej spółki z indeksu. 3. Różnice kultur raportowania (długość i konwencja raportów DE vs PL) mogą wpływać na normalizację na 1000 słów. 4. Klasyfikacja LLM bywa omylna; mityguje ją audytowalność każdej wzmianki i przegląd ręczny ≥10%. 5. Jeden okres — brak dynamiki (delta od Edycji 2). 6. Rok obrotowy Siemensa przesunięty względem pozostałych (patrz §3). 7. **Typ dokumentu jest w Edycji 1 niemal tożsamy z krajem** (spółki DE dostarczyły pełne raporty roczne, większość spółek PL — sprawozdania zarządu). Formalnie **nie da się w E1 oddzielić efektu kraju od efektu typu dokumentu**, dlatego porównanie DAX↔WIG20 podajemy wyłącznie jako przedział z zastrzeżeniem, a nie jako wynik. Twierdzenia stratyfikowane (gradient sektorowy) tym ograniczeniem nie są dotknięte. Naprawa w E2: dla spółek DE pobierać osobny *zusammengefasster Lagebericht* tam, gdzie publikowany jest rozdziałowo, albo raportować metrykę wyłącznie w podziale na typ dokumentu. ## 8. Zasady prawne i etyczne - Wyłącznie **dozwolony użytek**: krótkie cytaty (≤25 słów) z podaniem źródła; żadnej redystrybucji pełnych tekstów dokumentów. - Analizowane są wyłącznie dokumenty, które spółki same opublikowały na swoich stronach IR. - Raport nie stanowi rekomendacji inwestycyjnej. ## 9. Jak cytować > Boardroom AI Monitor, Edycja 1 (2026), A. Chądzyński — analiza raportów > rocznych FY2025 pięciu spółek DAX i pięciu spółek WIG20; metodyka v0.3. ## 10. Wersjonowanie | Wersja | Data | Zmiany | |---|---|---| | 0.1 | 2026-07-09 | Pierwsza wersja (faza 0, N=10, raporty roczne FY2025). | | 0.2 | 2026-07-10 | Słownik v0.2: „KI" tylko w dokumentach DE, „LLM" z wykluczeniem kontekstu akademickiego — korekta po audycie fałszywych trafień w E1 (§4). | | 0.3 | 2026-08-12 | Obowiązkowy test odporności każdej edycji (§5a) i jawne ograniczenie konfuzji typ dokumentu ↔ kraj (§7.7). Konsekwencja: degradacja porównania DAX↔WIG20 do przedziału, liczba-nagłówek E1 zmieniona na gradient sektorowy. | **Wersja obowiązująca: 0.3** (jedyne źródło numeru w kodzie: `METHODOLOGY_VERSION` w `report.py`; stopka strony i raport pobierają go stamtąd). **Zapowiedź v0.4** — wejdzie razem z reklasyfikacją E1 wg decyzji z przeglądu ręcznego z 2026-09-19 (`output/przeglad-probki-wynik-2026-09-19.md`): klasy MACRO i STRUKTURALNA poza rozkładem kontekstów, boty obsługi klienta = COST, substance oceniane na kontekście ±2 zdania. Do tego czasu klasyfikacja E1 ma status „w korekcie" (baner na stronie).