Podsumowanie spotkań z AI, pipeline OBS Studio, transkrypcja, baza wiedzy

,

Siedzę po spotkaniu projektowym. Mamy godzinę nagrania z Teams, trzy strony notatek odręcznych, sześć wątków na czacie i zero wspólnego podsumowania. Za tydzień na budowie okaże się, że nikt nie pamięta, kto miał dostarczyć […]

Siedzę po spotkaniu projektowym. Mamy godzinę nagrania z Teams, trzy strony notatek odręcznych, sześć wątków na czacie i zero wspólnego podsumowania. Za tydzień na budowie okaże się, że nikt nie pamięta, kto miał dostarczyć rysunki konstrukcji i zaczyna się szukanie winnych. Brzmi znajomo?

Postanowiłem to zmienić. Zbudowałem pipeline, który z nagrania spotkania robi gotową notatkę z decyzjami, osobami odpowiedzialnymi i terminami. Bez ręcznego przepisywania, bez odsłuchiwania dwóch godzin nagrania, bez „ktoś wyśle maila”.

W tym wpisie pokażę:

  • Cały łańcuch: nagranie -> transkrypcja -> podsumowanie -> baza wiedzy,
  • Jakie narzędzia wybrałem i dlaczego,
  • Konkretne polecenia i skrypty, które możesz odtworzyć,
  • Gdzie są oszczędności czasu – i co jeszcze można zautomatyzować,
  • Wady i ograniczenia – żebyś nie wpadł w te same pułapki co ja.
Podsumowanie spotkań AI - Dymek spotkania (Teams/Zoom) przechodzący przez lejek automatyzacji (ikony: mikrofon, transkrypcja, dokument) i wypadający jako czysta notatka w Obsidianie.

Narzędzia, które wybrałem

Pipeline oparłem na trzech elementach:

  • OBS Studio – nagrywanie ekranu i dźwięku. Za darmo, na każdą platformę.
  • Whisper (lokalnie) – transkrypcja audio na tekst. Dla większych plików można użyć API OpenAI Whisper, ale lokalna wersja (whisper.cpp lub faster-whisper) działa zaskakująco dobrze na dzisiejszym sprzęcie i chroni poufność danych projektowych.
  • Agent AI (Codex / Hermes) – podsumowanie, ekstrakcja decyzji, zapis do bazy wiedzy.

Całość działa z jednego skryptu shella. Uruchamiam go po spotkaniu, idę po kawę, wracam do gotowej notatki.

Pipeline krok po kroku

Krok 1: Nagranie (OBS Studio)

Nie zmieniam nawyków wchodzę na spotkanie w Teams/Zoom, pytam się o zgodę na nagrywanie uczestników i uruchamiam nagrywanie w OBS. Kluczowe ustawienia:

  • Kodek audio: AAC 128 kbps (wystarcza do transkrypcji, plik nie jest gigantyczny),
  • Nagrywanie tylko dźwięku pulpitu – nie potrzebuję obrazu, tylko słowa,
  • Hotkey: F9 – start/stop, nie muszę myszkować.

Można też użyć wbudowanego nagrywania Teams (365), wtedy plik jest generowany automatycznie. Problem: dla spotkań dłuższych niż 60 minut w darmowej wersji Teams nagranie znika po 21 dniach. Wolę mieć plik lokalnie.

Krok 2: Transkrypcja (Whisper)

Po spotkaniu uruchamiam:

whisper --model medium --language pl --task transcribe \
  spotkanie_2025_07_25.mp3 --output_format txt

Model „medium” daje mi dobry kompromis między szybkością a dokładnością dla polskiego. „Large-v3” jest lepszy, ale na laptopie bez GPU robi się powolny. Dla rutynowych spotkań – medium w zupełności wystarcza. Dla ważnych rozmów, gdzie każde słowo ma znaczenie – puszczam large na noc.

Wynik: plik .txt z dosłowną transkrypcją. Godzinne spotkanie daje około 10-12 tysięcy słów. Surowe, bez interpunkcji, bez oznaczenia mówców (chyba że użyję modelu z diarization, ale to osobna para kaloszy).

Krok 3: Podsumowanie przez AI

Tutaj wkracza agent AI. Przekazuję mu transkrypcję z instrukcją:

"Przeanalizuj tę transkrypcję spotkania i zwróć:
1. Listę uczestników (wywnioskuj z kontekstu)
2. Datę i cel spotkania (pierwsze 2 minuty)
3. Podjęte decyzje - każda w osobnym punkcie
4. Osoby odpowiedzialne (kto, za co, do kiedy)
5. Otwarte tematy (co wymaga dalszej analizy)
6. Kluczowe daty / milestone'y
Format: punkty z wypunktowaniem"

Agent zwraca gotowe podsumowanie w 10-20 sekund. Transkrypcja z godzinnego spotkania mieści się w kontekście większości modeli. Gdyby nie (zdarzają się spotkania 3-godzinne) – dzielę na segmenty po 30 minut i składam podsumowania.

Krok 4: Zapis do bazy wiedzy

Podsumowanie nie może leżeć w folderze Downloads – musi trafić do bazy wiedzy, żeby było wyszukiwalne. U mnie to katalog Obsidian z formatem YAML frontmatter:

---
title: "Spotkanie projektowe - Branża Sanitarna"
date: 2025-07-25
project: "Osiedle Słoneczne - Etap II"
participants: ["Paweł K.", "Michał N.", "Ewa P.", "Tomasz W."]
type: meeting
status: done
---

# Decyzje:
- Średnica przyłącza wody: DN 100 (decyzja: PW, MK)
- [...]

Agent tworzy ten plik automatycznie. Można go później przeszukać słowami „średnica przyłącza” i znaleźć decyzję z konkretnego spotkania.

Oszczędność czasu – konkretne liczby

Zmierzyłem dla typowego spotkania projektowego (60 minut, 6 osób):

  • Ręczna notatka: 25 minut (w trakcie spotkania) + 15 minut po (porządkowanie) = 40 minut,
  • Pipeline automatyczny: 2 minuty (uruchomienie skryptu) + 5 minut na weryfikację = 7 minut,
  • Różnica: 33 minuty zaoszczędzone na jednym spotkaniu.

Przy czterech spotkaniach tygodniowo daje to ponad dwie godziny tygodniowo. W skali miesiąca – cały dzień roboczy odzyskany.

Ale oszczędność czasu to nie wszystko. Jakość notatek też wzrosła. Agent nie pomija wątków, nie gubi decyzji, nie zapomina o terminach. Moja ręczna notatka z reguły miała luki – gdy sam dyskutowałem, nie notowałem. Agent ma całość transkrypcji, więc nic mu nie ucieknie.

Rozszerzenia – co jeszcze można zautomatyzować

Po podstawowym pipeline doszedłem do kilku usprawnień:

  • Wysyłka maila. Agent po utworzeniu notatki wysyła podsumowanie do uczestników: „Zgodnie z ustaleniami – załączam notatkę ze spotkania. Proszę o potwierdzenie do piątku.”
  • Aktualizacja harmonogramu. Jeśli na spotkaniu ustalono termin, agent aktualizuje wpis w kalendarzu lub arkuszu harmonogramu.
  • Kategoryzacja. Agent dodaje tagi na podstawie treści: „instalacje sanitarne”, „konstrukcja”, „pozwolenie na budowę” – później filtruję notatki po projekcie.
  • Podział na mówców. Użycie WhisperX lub pyannote do diarization – agent wie, kto co powiedział. Dla spotkań z kilkoma osobami to robi ogromną różnicę w czytelności.

Pułapki i ograniczenia

Nie wszystko jest różowe. Oto rzeczy, które mnie wkurzyły:

  • Jakość transkrypcji dla polskiego. Whisper radzi sobie dobrze, ale z terminami technicznymi bywa różnie. „Średnica nominalna” czasem wychodzi jako „szczednica nominalna”, a „DN 110” jako „de en sto dziesięć”. Trzeba poprawiać ręcznie.
  • Dźwięk z Teams. Jeśli ktoś mówi przez słuchawki, a ktoś przez głośnik w sali konferencyjnej różnica poziomów dźwięku jest ogromna. Część dialogów jest cicha i trudna do transkrypcji.
  • Hałas w tle. Budowa, wiertarki, ruch uliczny – Whisper sobie radzi, ale dokładność spada o 10-15%. Filtrowanie dźwięku (SoX, ffmpeg) przed transkrypcją pomaga.
  • Poufność. Jeśli nagrywam spotkanie z danymi wrażliwymi (koszty, ceny, dane osobowe), używam lokalnego Whispera i lokalnego modelu LLM. Żadne dane nie wychodzą poza mój komputer.

Podsumowanie

Automatyczne podsumowanie spotkań to dla mnie jeden z trzech nawyków, które realnie zmieniły produktywność w zeszłym roku. Nie chodzi o to, żeby AI prowadziło spotkania chodzi o to, żeby nikt nie musiał tracić czasu na pisanie notatki, skoro można to zrobić w 7 minut zamiast 40.

Jeśli masz w zespole rotacyjne notowanie (każdy tydzień ktoś inny prowadzi notatkę) tym bardziej warto. Jakość notatek przestaje zależeć od osoby, a zespół zyskuje jednolity standard dokumentacji spotkań.

Spróbuj na następnym spotkaniu. Nagraj (za zgodą uczestników!), przepuść przez Whisper, daj agentowi prompt z tej strony. Zobaczysz różnicę po pierwszym razie.

Sprawdź również:

Paweł Kińczyk
Paweł Kińczyk
Artykuły: 135

Newsletter

Chcesz być na bieżąco? Zapisz się do newslettera!

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *