Automatyczne wyciąganie danych z faktur i zamówień — jak to działa
Ręczne przepisywanie pozycji z faktur i zamówień do systemu to jedno z najlepszych zadań na pierwsze wdrożenie automatyzacji: jest powtarzalne, wykonywane codziennie, oparte na dokumentach i mierzalne co do minuty. Ma jednak jeden warunek, którego nie da się obejść — wynik musi być weryfikowalny, bo błąd w kwocie albo indeksie towaru kosztuje więcej niż zaoszczędzony czas.
Krótka odpowiedź: automatyczny odczyt łączy dwie warstwy — rozpoznanie tekstu z pliku (skan, zdjęcie, PDF) oraz zrozumienie struktury, czyli przypisanie fragmentów do pól: numer dokumentu, data, kontrahent, pozycje, kwoty.
Druga warstwa jest tą, w której modele językowe dają przewagę nad starszymi rozwiązaniami: radzą sobie z dokumentami o nieznanym układzie, bez konieczności definiowania szablonu dla każdego dostawcy.
Na czym polega problem
Firma dostaje dokumenty w kilkunastu układach graficznych, bo każdy kontrahent wystawia je po swojemu. Ten sam numer zamówienia bywa u góry po prawej, w stopce albo w treści. Pozycje raz mają kolumnę z indeksem, raz nie. Kwoty bywają z groszami po kropce, po przecinku, ze spacją jako separatorem tysięcy.
Człowiek radzi sobie z tym bez namysłu, bo rozumie, na co patrzy. Starsze rozwiązania automatyczne wymagały zdefiniowania szablonu dla każdego układu — działało to dopóty, dopóki dostawca nie zmienił wyglądu dokumentu.
Model językowy podchodzi do tego inaczej: zamiast szukać danych w określonym miejscu, rozumie, co oznacza „numer zamówienia" i znajduje go tam, gdzie faktycznie jest. Dzięki temu nowy dostawca nie wymaga konfiguracji.
Jak przebiega przetwarzanie
| Etap | Co się dzieje | Gdzie powstają błędy |
|---|---|---|
| 1. Odbiór | Dokument trafia ze skrzynki, skanera albo panelu | Załącznik w nietypowym formacie, dokument w treści wiadomości |
| 2. Rozpoznanie tekstu | Obraz zamieniany na tekst z zachowaniem układu | Słabej jakości skan, pieczątka na treści, dokument pod kątem |
| 3. Wyodrębnienie pól | Przypisanie fragmentów do pól docelowych | Niejednoznaczne etykiety, kilka dat na dokumencie |
| 4. Dopasowanie do bazy | Powiązanie kontrahenta i pozycji z kartotekami | Nazwa inna niż w systemie, brak indeksu towaru |
| 5. Walidacja | Sprawdzenie sum, kompletności, zgodności z zamówieniem | Tu wychwytuje się większość pomyłek wcześniejszych etapów |
| 6. Zatwierdzenie | Człowiek akceptuje albo poprawia | Automatyczne zatwierdzanie bez progu pewności |
Etap piąty jest tym, który decyduje o użyteczności całości. Suma pozycji musi zgadzać się z sumą dokumentu, liczba pozycji z zamówieniem, a kontrahent musi istnieć w kartotece. Te trzy proste kontrole wychwytują większość błędów, zanim dotrą do człowieka.
Jaką dokładność da się osiągnąć
Rozsądne oczekiwanie brzmi: przy dokumentach dobrej jakości i po dostrojeniu do własnego zbioru, zdecydowana większość dokumentów przechodzi bez poprawek, a reszta wymaga korekty pojedynczego pola. Zero błędów nie jest realnym celem i nie powinno być podstawą planowania.
Znacznie ważniejsza od samej dokładności jest rozpoznawalność błędu. System, który myli się rzadko, ale w sposób niemożliwy do wykrycia, jest gorszy od takiego, który myli się częściej i sam sygnalizuje niepewność.
Uwaga praktyczna: wymagaj, żeby system zwracał wraz z każdym polem informację o pewności odczytu. Pola poniżej ustalonego progu trafiają do sprawdzenia, reszta przechodzi automatycznie. Bez tego mechanizmu człowiek musi weryfikować wszystko — a wtedy oszczędność jest pozorna.
Co wpływa na jakość odczytu
- Format źródłowy. Dokument elektroniczny z warstwą tekstową odczytuje się niemal bezbłędnie. Zdjęcie zrobione telefonem pod kątem to zupełnie inna klasa trudności.
- Jakość skanu. Rozdzielczość, kontrast, brak zagięć i pieczątek nachodzących na treść.
- Powtarzalność układu. Kilku stałych dostawców jest łatwiejszych niż stale zmieniający się zbiór.
- Kompletność kartotek. Dopasowanie kontrahenta i towaru wymaga, żeby istniały w systemie pod rozpoznawalną nazwą.
- Jednoznaczność pól. Dokument z trzema datami wymaga reguły, która z nich jest datą sprzedaży.
- Zbiór przykładów. Kilkadziesiąt realnych dokumentów z poprawnym odczytem pozwala zmierzyć jakość, zanim system trafi do pracy.
Dopasowanie do kartotek — trudniejsze niż odczyt
Odczytanie nazwy kontrahenta z dokumentu jest stosunkowo proste. Znacznie trudniejsze jest ustalenie, że „Przedsiębiorstwo Handlowe Kowalski sp. z o.o." z faktury to ten sam podmiot, co „PH Kowalski" w Twoim systemie.
Rozwiązaniem jest identyfikator, a nie nazwa. Numer identyfikacji podatkowej odczytany z dokumentu daje jednoznaczne dopasowanie. Przy pozycjach towarowych analogiczną rolę pełni indeks lub kod kreskowy — jeśli dostawca ich nie podaje, dopasowanie po nazwie zawsze będzie wymagało nadzoru.
Warto też przewidzieć mechanizm uczenia się: gdy człowiek raz poprawi dopasowanie, system powinien zapamiętać ten wybór dla przyszłych dokumentów od tego samego wystawcy.
Jak policzyć opłacalność
Rachunek jest prostszy niż przy większości wdrożeń, bo wszystkie składniki da się zmierzyć.
- Ile dokumentów przetwarzacie miesięcznie.
- Ile minut zajmuje ręczne wprowadzenie jednego.
- Jaki odsetek będzie wymagał poprawki i ile ona zajmie.
- Ile kosztują pomyłki — korekty dokumentów, wyjaśnienia z kontrahentem, rozbieżności w rozliczeniach.
- Ile kosztuje utrzymanie — rozliczenie za przetworzone dokumenty plus opieka techniczna.
Przy kilkudziesięciu dokumentach miesięcznie rachunek zwykle nie wychodzi. Przy kilkuset dziennie wychodzi z dużym zapasem. Pomiędzy tymi skrajnościami decyduje to, ile kosztuje jedna pomyłka i jak bardzo obciążony jest zespół.
Jak wdrożyć bezpiecznie
Kolejność jest tu ważniejsza niż w innych projektach, bo dane trafiają wprost do systemów rozliczeniowych.
- Zbierz zbiór testowy — kilkadziesiąt dokumentów obejmujących także te trudne: słabe skany, nietypowych dostawców, dokumenty z korektami.
- Zmierz stan wyjściowy — czas wprowadzenia i obecną liczbę pomyłek. Bez tego nie ocenisz efektu.
- Uruchom w trybie równoległym — system odczytuje, człowiek wprowadza jak dotąd, porównujecie wyniki.
- Ustaw próg pewności, powyżej którego pole przechodzi bez sprawdzania.
- Wdroż walidację przed zatwierdzeniem — sumy, kompletność, zgodność z zamówieniem.
- Zostaw dziennik pozwalający ustalić, skąd wzięła się każda wartość.
- Nie automatyzuj księgowania na starcie. Odczyt tak, zatwierdzenie u człowieka.
Czego nie automatyzować
- Dokumentów o wysokiej wartości bez kontroli człowieka, niezależnie od dokładności systemu.
- Korekt i dokumentów nietypowych — występują rzadko, więc system ma na nich najmniej doświadczenia, a skutki błędu są największe.
- Rozstrzygania rozbieżności między zamówieniem a dostawą. System może je wykryć, decyzję podejmuje człowiek.
- Dokumentów w obcych walutach bez jasnej reguły przeliczania i jej udokumentowania.
- Ostatecznego księgowania. To czynność nieodwracalna o skutkach podatkowych.
Dane i poufność
Dokumenty handlowe zawierają dane kontrahentów, warunki współpracy i kwoty. Wysłanie ich do zewnętrznego dostawcy modelu oznacza przekazanie tych informacji poza firmę.
Wymaga to umowy powierzenia przetwarzania, ustalenia, jakie kategorie dokumentów mogą opuścić firmę, oraz ujęcia tego w dokumentacji ochrony danych. Przy dokumentach objętych szczególną poufnością — umowach, cennikach indywidualnych — warto rozważyć model uruchamiany na własnej infrastrukturze, kosztem wyższych wymagań sprzętowych. Szerzej opisaliśmy tę kwestię w materiale o AI w firmie.
Połączenie z systemem firmy
Odczyt bez zapisu do systemu magazynowego lub księgowego daje połowę korzyści — dane nadal ktoś przepisuje, tylko z ekranu zamiast z papieru.
Pełna wartość pojawia się przy integracji, która wprowadza zatwierdzony dokument bezpośrednio do systemu. Wymaga to interfejsu po stronie tego systemu i obsługi sytuacji wyjątkowych: co przy kontrahencie nieistniejącym w kartotece, co przy pozycji bez indeksu, co przy dokumencie wprowadzonym już wcześniej ręcznie. O tym, jak takie połączenia projektować, pisaliśmy w materiale o integracji z ERP.
Co dalej po odczycie
Sam odczyt to początek procesu. Wartość rośnie, gdy dokument idzie dalej bez ręcznego przekładania między systemami i skrzynkami.
Automatyczne kierowanie do akceptacji
Dokument po odczycie może trafić od razu do właściwej osoby — według kwoty, kategorii kosztu albo działu wskazanego w zamówieniu. To eliminuje etap, w którym ktoś przegląda skrzynkę i rozdziela sprawy ręcznie.
Porównanie z zamówieniem
Jeśli w systemie istnieje zamówienie, do którego dokument się odnosi, warto zestawić je automatycznie: czy pozycje się zgadzają, czy ilości są zgodne, czy ceny odpowiadają ustaleniom. Rozbieżności wychwycone na tym etapie kosztują minutę wyjaśnienia, a wykryte po zapłacie — znacznie więcej.
Wykrywanie duplikatów
Ten sam dokument potrafi przyjść dwa razy — raz mailem, raz pocztą. Sprawdzenie numeru i wystawcy przed wprowadzeniem zapobiega podwójnemu zaksięgowaniu, które bywa kosztowne i trudne do wykrycia po fakcie.
Archiwum z możliwością wyszukania
Odczytane dane pozwalają przeszukiwać dokumenty po treści, nie tylko po nazwie pliku. Pytanie „ile wydaliśmy u tego dostawcy w zeszłym kwartale" przestaje wymagać przeglądania segregatora.
Każdy z tych elementów da się wdrożyć osobno i każdy zwraca się samodzielnie. Warto dokładać je stopniowo, w kolejności od tego, co dziś zajmuje najwięcej czasu.
Podsumowanie
Automatyczny odczyt dokumentów to jedno z najbezpieczniejszych pierwszych wdrożeń: zadanie jest powtarzalne, mierzalne co do minuty, a błąd wychwytuje walidacja sum, zanim dotrze dalej. Warunkiem powodzenia jest jednak mechanizm pewności odczytu — bez niego człowiek sprawdza wszystko i oszczędność znika.
Zacznij od policzenia dwóch liczb: ile dokumentów przetwarzacie miesięcznie i ile minut zajmuje wprowadzenie jednego. Jeśli iloczyn liczy się w dziesiątkach godzin, projekt niemal na pewno się zwróci. Jeśli w pojedynczych — poszukaj innego kandydata, na przykład wśród procesów opisanych w materiale o wyborze pierwszego procesu.
Najczęstsze pytania
Przy dokumentach elektronicznych z warstwą tekstową zdecydowana większość przechodzi bez poprawek, przy skanach jakość zależy od rozdzielczości i czytelności. Ważniejsza od samej dokładności jest rozpoznawalność błędu — system powinien zwracać poziom pewności dla każdego pola, żeby wątpliwe trafiały do sprawdzenia.
Tak, i to jest główna przewaga rozwiązań opartych na modelach językowych nad starszymi. Nie wymagają definiowania szablonu dla każdego układu graficznego, ponieważ rozumieją znaczenie pól i znajdują je tam, gdzie faktycznie występują, zamiast szukać w z góry określonym miejscu.
Przy kilkudziesięciu dokumentach rachunek zwykle nie wychodzi, przy kilkuset dziennie wychodzi z dużym zapasem. Pomiędzy decyduje koszt pojedynczej pomyłki oraz obciążenie zespołu. Warto policzyć iloczyn liczby dokumentów i minut potrzebnych na wprowadzenie jednego — to punkt wyjścia.
Odczyt i przygotowanie danych tak, ostateczne księgowanie nie. To czynność nieodwracalna o skutkach podatkowych, więc powinna wymagać zatwierdzenia przez człowieka. Bezpieczny układ to automatyczny odczyt z walidacją sum i kompletności oraz akceptacja przed wprowadzeniem do systemu.
Dokument powinien trafić do osobnej listy wymagającej decyzji człowieka, a nie zostać wprowadzony z niepełnymi danymi. Warto też przewidzieć mechanizm zapamiętywania: gdy pracownik raz wskaże właściwe dopasowanie, system stosuje je automatycznie przy kolejnych dokumentach od tego wystawcy.
Convert Studio realizuje projekty z tego obszaru dla firm w całej Polsce. Zobacz: AI i automatyzacja → · Lokalizacje →
Bezpłatna wycena Twojego projektu
Opisz w kilku zdaniach, co chcesz zbudować — stronę, aplikację czy sklep. Odpowiadamy w ciągu 24 godzin roboczych konkretną propozycją zakresu i harmonogramu. Konsultacja i wycena są bezpłatne, bez zobowiązań.