Usługi AI dla firm Realizacje Blog FAQ Rozpocznij projekt

Automatyczne wyciąganie danych z faktur i zamówień — jak to działa

Ręczne przepisywanie pozycji z faktur i zamówień do systemu to jedno z najlepszych zadań na pierwsze wdrożenie automatyzacji: jest powtarzalne, wykonywane codziennie, oparte na dokumentach i mierzalne co do minuty. Ma jednak jeden warunek, którego nie da się obejść — wynik musi być weryfikowalny, bo błąd w kwocie albo indeksie towaru kosztuje więcej niż zaoszczędzony czas.

Krótka odpowiedź: automatyczny odczyt łączy dwie warstwy — rozpoznanie tekstu z pliku (skan, zdjęcie, PDF) oraz zrozumienie struktury, czyli przypisanie fragmentów do pól: numer dokumentu, data, kontrahent, pozycje, kwoty.

Druga warstwa jest tą, w której modele językowe dają przewagę nad starszymi rozwiązaniami: radzą sobie z dokumentami o nieznanym układzie, bez konieczności definiowania szablonu dla każdego dostawcy.

Na czym polega problem

Firma dostaje dokumenty w kilkunastu układach graficznych, bo każdy kontrahent wystawia je po swojemu. Ten sam numer zamówienia bywa u góry po prawej, w stopce albo w treści. Pozycje raz mają kolumnę z indeksem, raz nie. Kwoty bywają z groszami po kropce, po przecinku, ze spacją jako separatorem tysięcy.

Człowiek radzi sobie z tym bez namysłu, bo rozumie, na co patrzy. Starsze rozwiązania automatyczne wymagały zdefiniowania szablonu dla każdego układu — działało to dopóty, dopóki dostawca nie zmienił wyglądu dokumentu.

Model językowy podchodzi do tego inaczej: zamiast szukać danych w określonym miejscu, rozumie, co oznacza „numer zamówienia" i znajduje go tam, gdzie faktycznie jest. Dzięki temu nowy dostawca nie wymaga konfiguracji.

Jak przebiega przetwarzanie

EtapCo się dziejeGdzie powstają błędy
1. Odbiór Dokument trafia ze skrzynki, skanera albo panelu Załącznik w nietypowym formacie, dokument w treści wiadomości
2. Rozpoznanie tekstu Obraz zamieniany na tekst z zachowaniem układu Słabej jakości skan, pieczątka na treści, dokument pod kątem
3. Wyodrębnienie pól Przypisanie fragmentów do pól docelowych Niejednoznaczne etykiety, kilka dat na dokumencie
4. Dopasowanie do bazy Powiązanie kontrahenta i pozycji z kartotekami Nazwa inna niż w systemie, brak indeksu towaru
5. Walidacja Sprawdzenie sum, kompletności, zgodności z zamówieniem Tu wychwytuje się większość pomyłek wcześniejszych etapów
6. Zatwierdzenie Człowiek akceptuje albo poprawia Automatyczne zatwierdzanie bez progu pewności

Etap piąty jest tym, który decyduje o użyteczności całości. Suma pozycji musi zgadzać się z sumą dokumentu, liczba pozycji z zamówieniem, a kontrahent musi istnieć w kartotece. Te trzy proste kontrole wychwytują większość błędów, zanim dotrą do człowieka.

Jaką dokładność da się osiągnąć

Rozsądne oczekiwanie brzmi: przy dokumentach dobrej jakości i po dostrojeniu do własnego zbioru, zdecydowana większość dokumentów przechodzi bez poprawek, a reszta wymaga korekty pojedynczego pola. Zero błędów nie jest realnym celem i nie powinno być podstawą planowania.

Znacznie ważniejsza od samej dokładności jest rozpoznawalność błędu. System, który myli się rzadko, ale w sposób niemożliwy do wykrycia, jest gorszy od takiego, który myli się częściej i sam sygnalizuje niepewność.

Uwaga praktyczna: wymagaj, żeby system zwracał wraz z każdym polem informację o pewności odczytu. Pola poniżej ustalonego progu trafiają do sprawdzenia, reszta przechodzi automatycznie. Bez tego mechanizmu człowiek musi weryfikować wszystko — a wtedy oszczędność jest pozorna.

Co wpływa na jakość odczytu

Dopasowanie do kartotek — trudniejsze niż odczyt

Odczytanie nazwy kontrahenta z dokumentu jest stosunkowo proste. Znacznie trudniejsze jest ustalenie, że „Przedsiębiorstwo Handlowe Kowalski sp. z o.o." z faktury to ten sam podmiot, co „PH Kowalski" w Twoim systemie.

Rozwiązaniem jest identyfikator, a nie nazwa. Numer identyfikacji podatkowej odczytany z dokumentu daje jednoznaczne dopasowanie. Przy pozycjach towarowych analogiczną rolę pełni indeks lub kod kreskowy — jeśli dostawca ich nie podaje, dopasowanie po nazwie zawsze będzie wymagało nadzoru.

Warto też przewidzieć mechanizm uczenia się: gdy człowiek raz poprawi dopasowanie, system powinien zapamiętać ten wybór dla przyszłych dokumentów od tego samego wystawcy.

Jak policzyć opłacalność

Rachunek jest prostszy niż przy większości wdrożeń, bo wszystkie składniki da się zmierzyć.

Przy kilkudziesięciu dokumentach miesięcznie rachunek zwykle nie wychodzi. Przy kilkuset dziennie wychodzi z dużym zapasem. Pomiędzy tymi skrajnościami decyduje to, ile kosztuje jedna pomyłka i jak bardzo obciążony jest zespół.

Jak wdrożyć bezpiecznie

Kolejność jest tu ważniejsza niż w innych projektach, bo dane trafiają wprost do systemów rozliczeniowych.

Czego nie automatyzować

Dane i poufność

Dokumenty handlowe zawierają dane kontrahentów, warunki współpracy i kwoty. Wysłanie ich do zewnętrznego dostawcy modelu oznacza przekazanie tych informacji poza firmę.

Wymaga to umowy powierzenia przetwarzania, ustalenia, jakie kategorie dokumentów mogą opuścić firmę, oraz ujęcia tego w dokumentacji ochrony danych. Przy dokumentach objętych szczególną poufnością — umowach, cennikach indywidualnych — warto rozważyć model uruchamiany na własnej infrastrukturze, kosztem wyższych wymagań sprzętowych. Szerzej opisaliśmy tę kwestię w materiale o AI w firmie.

Połączenie z systemem firmy

Odczyt bez zapisu do systemu magazynowego lub księgowego daje połowę korzyści — dane nadal ktoś przepisuje, tylko z ekranu zamiast z papieru.

Pełna wartość pojawia się przy integracji, która wprowadza zatwierdzony dokument bezpośrednio do systemu. Wymaga to interfejsu po stronie tego systemu i obsługi sytuacji wyjątkowych: co przy kontrahencie nieistniejącym w kartotece, co przy pozycji bez indeksu, co przy dokumencie wprowadzonym już wcześniej ręcznie. O tym, jak takie połączenia projektować, pisaliśmy w materiale o integracji z ERP.

Co dalej po odczycie

Sam odczyt to początek procesu. Wartość rośnie, gdy dokument idzie dalej bez ręcznego przekładania między systemami i skrzynkami.

Automatyczne kierowanie do akceptacji

Dokument po odczycie może trafić od razu do właściwej osoby — według kwoty, kategorii kosztu albo działu wskazanego w zamówieniu. To eliminuje etap, w którym ktoś przegląda skrzynkę i rozdziela sprawy ręcznie.

Porównanie z zamówieniem

Jeśli w systemie istnieje zamówienie, do którego dokument się odnosi, warto zestawić je automatycznie: czy pozycje się zgadzają, czy ilości są zgodne, czy ceny odpowiadają ustaleniom. Rozbieżności wychwycone na tym etapie kosztują minutę wyjaśnienia, a wykryte po zapłacie — znacznie więcej.

Wykrywanie duplikatów

Ten sam dokument potrafi przyjść dwa razy — raz mailem, raz pocztą. Sprawdzenie numeru i wystawcy przed wprowadzeniem zapobiega podwójnemu zaksięgowaniu, które bywa kosztowne i trudne do wykrycia po fakcie.

Archiwum z możliwością wyszukania

Odczytane dane pozwalają przeszukiwać dokumenty po treści, nie tylko po nazwie pliku. Pytanie „ile wydaliśmy u tego dostawcy w zeszłym kwartale" przestaje wymagać przeglądania segregatora.

Każdy z tych elementów da się wdrożyć osobno i każdy zwraca się samodzielnie. Warto dokładać je stopniowo, w kolejności od tego, co dziś zajmuje najwięcej czasu.

Podsumowanie

Automatyczny odczyt dokumentów to jedno z najbezpieczniejszych pierwszych wdrożeń: zadanie jest powtarzalne, mierzalne co do minuty, a błąd wychwytuje walidacja sum, zanim dotrze dalej. Warunkiem powodzenia jest jednak mechanizm pewności odczytu — bez niego człowiek sprawdza wszystko i oszczędność znika.

Zacznij od policzenia dwóch liczb: ile dokumentów przetwarzacie miesięcznie i ile minut zajmuje wprowadzenie jednego. Jeśli iloczyn liczy się w dziesiątkach godzin, projekt niemal na pewno się zwróci. Jeśli w pojedynczych — poszukaj innego kandydata, na przykład wśród procesów opisanych w materiale o wyborze pierwszego procesu.

Najczęstsze pytania

Przy dokumentach elektronicznych z warstwą tekstową zdecydowana większość przechodzi bez poprawek, przy skanach jakość zależy od rozdzielczości i czytelności. Ważniejsza od samej dokładności jest rozpoznawalność błędu — system powinien zwracać poziom pewności dla każdego pola, żeby wątpliwe trafiały do sprawdzenia.

Tak, i to jest główna przewaga rozwiązań opartych na modelach językowych nad starszymi. Nie wymagają definiowania szablonu dla każdego układu graficznego, ponieważ rozumieją znaczenie pól i znajdują je tam, gdzie faktycznie występują, zamiast szukać w z góry określonym miejscu.

Przy kilkudziesięciu dokumentach rachunek zwykle nie wychodzi, przy kilkuset dziennie wychodzi z dużym zapasem. Pomiędzy decyduje koszt pojedynczej pomyłki oraz obciążenie zespołu. Warto policzyć iloczyn liczby dokumentów i minut potrzebnych na wprowadzenie jednego — to punkt wyjścia.

Odczyt i przygotowanie danych tak, ostateczne księgowanie nie. To czynność nieodwracalna o skutkach podatkowych, więc powinna wymagać zatwierdzenia przez człowieka. Bezpieczny układ to automatyczny odczyt z walidacją sum i kompletności oraz akceptacja przed wprowadzeniem do systemu.

Dokument powinien trafić do osobnej listy wymagającej decyzji człowieka, a nie zostać wprowadzony z niepełnymi danymi. Warto też przewidzieć mechanizm zapamiętywania: gdy pracownik raz wskaże właściwe dopasowanie, system stosuje je automatycznie przy kolejnych dokumentach od tego wystawcy.

Convert Studio realizuje projekty z tego obszaru dla firm w całej Polsce. Zobacz: AI i automatyzacja → · Lokalizacje →

Bezpłatna wycena Twojego projektu

Opisz w kilku zdaniach, co chcesz zbudować — stronę, aplikację czy sklep. Odpowiadamy w ciągu 24 godzin roboczych konkretną propozycją zakresu i harmonogramu. Konsultacja i wycena są bezpłatne, bez zobowiązań.

Odpowiedź w 24 h roboczych. Dane wykorzystujemy wyłącznie do kontaktu w sprawie zapytania — polityka prywatności.