Siedzę po spotkaniu projektowym. Mamy godzinę nagrania z Teams, trzy strony notatek odręcznych, sześć wątków na czacie i zero wspólnego podsumowania. Za tydzień na budowie okaże się, że nikt nie pamięta, kto miał dostarczyć […]
Siedzę po spotkaniu projektowym. Mamy godzinę nagrania z Teams, trzy strony notatek odręcznych, sześć wątków na czacie i zero wspólnego podsumowania. Za tydzień na budowie okaże się, że nikt nie pamięta, kto miał dostarczyć rysunki konstrukcji i zaczyna się szukanie winnych. Brzmi znajomo?
Postanowiłem to zmienić. Zbudowałem pipeline, który z nagrania spotkania robi gotową notatkę z decyzjami, osobami odpowiedzialnymi i terminami. Bez ręcznego przepisywania, bez odsłuchiwania dwóch godzin nagrania, bez „ktoś wyśle maila”.
W tym wpisie pokażę:
- Cały łańcuch: nagranie -> transkrypcja -> podsumowanie -> baza wiedzy,
- Jakie narzędzia wybrałem i dlaczego,
- Konkretne polecenia i skrypty, które możesz odtworzyć,
- Gdzie są oszczędności czasu – i co jeszcze można zautomatyzować,
- Wady i ograniczenia – żebyś nie wpadł w te same pułapki co ja.

Narzędzia, które wybrałem
Pipeline oparłem na trzech elementach:
- OBS Studio – nagrywanie ekranu i dźwięku. Za darmo, na każdą platformę.
- Whisper (lokalnie) – transkrypcja audio na tekst. Dla większych plików można użyć API OpenAI Whisper, ale lokalna wersja (whisper.cpp lub faster-whisper) działa zaskakująco dobrze na dzisiejszym sprzęcie i chroni poufność danych projektowych.
- Agent AI (Codex / Hermes) – podsumowanie, ekstrakcja decyzji, zapis do bazy wiedzy.
Całość działa z jednego skryptu shella. Uruchamiam go po spotkaniu, idę po kawę, wracam do gotowej notatki.
Pipeline krok po kroku
Krok 1: Nagranie (OBS Studio)
Nie zmieniam nawyków wchodzę na spotkanie w Teams/Zoom, pytam się o zgodę na nagrywanie uczestników i uruchamiam nagrywanie w OBS. Kluczowe ustawienia:
- Kodek audio: AAC 128 kbps (wystarcza do transkrypcji, plik nie jest gigantyczny),
- Nagrywanie tylko dźwięku pulpitu – nie potrzebuję obrazu, tylko słowa,
- Hotkey: F9 – start/stop, nie muszę myszkować.
Można też użyć wbudowanego nagrywania Teams (365), wtedy plik jest generowany automatycznie. Problem: dla spotkań dłuższych niż 60 minut w darmowej wersji Teams nagranie znika po 21 dniach. Wolę mieć plik lokalnie.
Krok 2: Transkrypcja (Whisper)
Po spotkaniu uruchamiam:
whisper --model medium --language pl --task transcribe \
spotkanie_2025_07_25.mp3 --output_format txt
Model „medium” daje mi dobry kompromis między szybkością a dokładnością dla polskiego. „Large-v3” jest lepszy, ale na laptopie bez GPU robi się powolny. Dla rutynowych spotkań – medium w zupełności wystarcza. Dla ważnych rozmów, gdzie każde słowo ma znaczenie – puszczam large na noc.
Wynik: plik .txt z dosłowną transkrypcją. Godzinne spotkanie daje około 10-12 tysięcy słów. Surowe, bez interpunkcji, bez oznaczenia mówców (chyba że użyję modelu z diarization, ale to osobna para kaloszy).
Krok 3: Podsumowanie przez AI
Tutaj wkracza agent AI. Przekazuję mu transkrypcję z instrukcją:
"Przeanalizuj tę transkrypcję spotkania i zwróć:
1. Listę uczestników (wywnioskuj z kontekstu)
2. Datę i cel spotkania (pierwsze 2 minuty)
3. Podjęte decyzje - każda w osobnym punkcie
4. Osoby odpowiedzialne (kto, za co, do kiedy)
5. Otwarte tematy (co wymaga dalszej analizy)
6. Kluczowe daty / milestone'y
Format: punkty z wypunktowaniem"
Agent zwraca gotowe podsumowanie w 10-20 sekund. Transkrypcja z godzinnego spotkania mieści się w kontekście większości modeli. Gdyby nie (zdarzają się spotkania 3-godzinne) – dzielę na segmenty po 30 minut i składam podsumowania.
Krok 4: Zapis do bazy wiedzy
Podsumowanie nie może leżeć w folderze Downloads – musi trafić do bazy wiedzy, żeby było wyszukiwalne. U mnie to katalog Obsidian z formatem YAML frontmatter:
---
title: "Spotkanie projektowe - Branża Sanitarna"
date: 2025-07-25
project: "Osiedle Słoneczne - Etap II"
participants: ["Paweł K.", "Michał N.", "Ewa P.", "Tomasz W."]
type: meeting
status: done
---
# Decyzje:
- Średnica przyłącza wody: DN 100 (decyzja: PW, MK)
- [...]
Agent tworzy ten plik automatycznie. Można go później przeszukać słowami „średnica przyłącza” i znaleźć decyzję z konkretnego spotkania.
Oszczędność czasu – konkretne liczby
Zmierzyłem dla typowego spotkania projektowego (60 minut, 6 osób):
- Ręczna notatka: 25 minut (w trakcie spotkania) + 15 minut po (porządkowanie) = 40 minut,
- Pipeline automatyczny: 2 minuty (uruchomienie skryptu) + 5 minut na weryfikację = 7 minut,
- Różnica: 33 minuty zaoszczędzone na jednym spotkaniu.
Przy czterech spotkaniach tygodniowo daje to ponad dwie godziny tygodniowo. W skali miesiąca – cały dzień roboczy odzyskany.
Ale oszczędność czasu to nie wszystko. Jakość notatek też wzrosła. Agent nie pomija wątków, nie gubi decyzji, nie zapomina o terminach. Moja ręczna notatka z reguły miała luki – gdy sam dyskutowałem, nie notowałem. Agent ma całość transkrypcji, więc nic mu nie ucieknie.
Rozszerzenia – co jeszcze można zautomatyzować
Po podstawowym pipeline doszedłem do kilku usprawnień:
- Wysyłka maila. Agent po utworzeniu notatki wysyła podsumowanie do uczestników: „Zgodnie z ustaleniami – załączam notatkę ze spotkania. Proszę o potwierdzenie do piątku.”
- Aktualizacja harmonogramu. Jeśli na spotkaniu ustalono termin, agent aktualizuje wpis w kalendarzu lub arkuszu harmonogramu.
- Kategoryzacja. Agent dodaje tagi na podstawie treści: „instalacje sanitarne”, „konstrukcja”, „pozwolenie na budowę” – później filtruję notatki po projekcie.
- Podział na mówców. Użycie WhisperX lub pyannote do diarization – agent wie, kto co powiedział. Dla spotkań z kilkoma osobami to robi ogromną różnicę w czytelności.
Pułapki i ograniczenia
Nie wszystko jest różowe. Oto rzeczy, które mnie wkurzyły:
- Jakość transkrypcji dla polskiego. Whisper radzi sobie dobrze, ale z terminami technicznymi bywa różnie. „Średnica nominalna” czasem wychodzi jako „szczednica nominalna”, a „DN 110” jako „de en sto dziesięć”. Trzeba poprawiać ręcznie.
- Dźwięk z Teams. Jeśli ktoś mówi przez słuchawki, a ktoś przez głośnik w sali konferencyjnej różnica poziomów dźwięku jest ogromna. Część dialogów jest cicha i trudna do transkrypcji.
- Hałas w tle. Budowa, wiertarki, ruch uliczny – Whisper sobie radzi, ale dokładność spada o 10-15%. Filtrowanie dźwięku (SoX, ffmpeg) przed transkrypcją pomaga.
- Poufność. Jeśli nagrywam spotkanie z danymi wrażliwymi (koszty, ceny, dane osobowe), używam lokalnego Whispera i lokalnego modelu LLM. Żadne dane nie wychodzą poza mój komputer.
Podsumowanie
Automatyczne podsumowanie spotkań to dla mnie jeden z trzech nawyków, które realnie zmieniły produktywność w zeszłym roku. Nie chodzi o to, żeby AI prowadziło spotkania chodzi o to, żeby nikt nie musiał tracić czasu na pisanie notatki, skoro można to zrobić w 7 minut zamiast 40.
Jeśli masz w zespole rotacyjne notowanie (każdy tydzień ktoś inny prowadzi notatkę) tym bardziej warto. Jakość notatek przestaje zależeć od osoby, a zespół zyskuje jednolity standard dokumentacji spotkań.
Spróbuj na następnym spotkaniu. Nagraj (za zgodą uczestników!), przepuść przez Whisper, daj agentowi prompt z tej strony. Zobaczysz różnicę po pierwszym razie.
Sprawdź również:
- 10 darmowych alternatyw open-source, które zastąpią Twoje drogie subskrypcje
- Podsumowanie spotkań z AI, pipeline OBS Studio, transkrypcja, baza wiedzy
- Alternatywy dla Obsidiana, Logseq, Notion, Capacities
- Rozmawiaj z Excelem, jak połączyć Codexa z arkuszem kalkulacyjnym
- GitHub jako repozytorium dokumentacji projektowej, wersjonowanie opisów i zestawień



