API do ekstrakcji dokumentów - każdy dostawca wygrywa własne demo

Najważniejsze informacje:

  • API do ekstrakcji dokumentów dostarcza etykietowane pola, tabele i pozycje (line items) z plików PDF, skanów lub wiadomości e-mail. OCR dostarcza jedynie znaki i pozostawia interpretację ich znaczenia Tobie.
  • Ekstrakcja oparta na szablonach i na AI to dwa różne produkty. Szablony psują się, gdy dostawca przesunie sumę w inne miejsce, natomiast ekstrakcja AI potrafi odczytać układy, których wcześniej nie widziała.
  • Oceniaj dostawców na podstawie dokładności wydobycia pól we własnych dokumentach. Liczba w arkuszu danych dostawcy została zmierzona na jego testowych przykładach.
  • Parseur udostępnia API dla deweloperów oraz aplikację internetową, którą może obsługiwać zespół operacyjny, dzięki czemu nikt nie musi marnować czasu na tworzenie autorskiego narzędzia do sprawdzania danych.
  • Parseur jest hostowany w UE, dane są przetwarzane i przechowywane w Unii Europejskiej i nigdy nie są wykorzystywane do trenowania modeli sztucznej inteligencji.

API do ekstrakcji dokumentów to usługa, która pobiera plik, taki jak PDF, zeskanowany obraz lub wiadomość e-mail, i zwraca ustrukturyzowane dane, na przykład w formacie JSON lub CSV. W przeciwieństwie do surowego OCR, który zwraca czysty tekst i pozostawia odnalezienie sensu użytkownikowi, API do ekstrakcji dokumentów identyfikuje i zachowuje strukturę: pary klucz-wartość, tabele, pozycje i etykietowane pola.

Są trzej kuzyni, z którymi API ekstrakcyjne często bywa mylone. Publiczne API dla danych dostarczają gotowe zbiory, które ktoś już przygotował. API do web scrapingu (pobierania danych z sieci) pozyskują to, co znajduje się na stronach internetowych. A silniki OCR? Tylko znaki, brak struktury. API do ekstrakcji dokumentów pracuje na Twoich dokumentach, na tych, które już leżą w skrzynce odbiorczej, i zamienia je w dane gotowe do wykorzystania w systemie. Niektórzy dostawcy sprzedają to samo pod nazwą "document understanding API" (API do analizy dokumentów) lub w formie SDK do ekstrakcji dokumentów. Inna nazwa, to samo zadanie. Wciąż próbujesz ustalić, z którym problemem masz do czynienia? Zestawiliśmy ze sobą parsowanie dokumentów a web scraping.

Według Research and Markets, rynek inteligentnego przetwarzania dokumentów, obejmujący API do ekstrakcji dokumentów, jest wyceniany na około 3,01 miliarda dolarów i przewiduje się, że wzrośnie przy wskaźniku CAGR na poziomie 31,7%. Liczba ta jest tak naprawdę odzwierciedleniem potężnej ilości faktur, wyciągów i formularzy — każdego dnia ktoś, albo coś musi je wszystkie przeczytać. W wielu firmach "tym czymś" nadal jest pracownik posiadający drugi monitor i korzystający z klawiatury numerycznej.

Szybkie przykłady:

  • Faktura PDF → JSON z polami nagłówkowymi i tablicą pozycji
  • Formularz wdrożeniowy → etykietowane pary klucz-wartość (imię i nazwisko, adres, podpis)
  • Wyciąg bankowy → tabela transakcji wyeksportowana do pliku CSV

Pięć rodzajów dostawców pod tą samą etykietą

Wpisz "API do ekstrakcji dokumentów" w wyszukiwarce, a otrzymasz kilkunastu dostawców, którzy dzielą wspólną kategorię, ale poza tym prawie nic ich nie łączy. Prawda jest taka, że oni tak naprawdę ze sobą nie konkurują, bo są stworzeni do pięciu różnych zadań. Każdy z nich wypadnie świetnie we własnym demo, dlatego odpowiedni dobór grupy narzędzi jest o wiele ważniejszy niż sam marketing. Najpierw zastanów się, do której kategorii należysz, zanim umówisz się na chociażby jedną rozmowę.

Rodzaj dostawcy Przykłady Dla kogo to powstało Co musisz nadal zbudować sam
Chmurowe bloki konstrukcyjne Google Document AI, Azure Document Intelligence, AWS Textract Zespoły pracujące już na konkretnej chmurze, dla których ekstrakcja to tylko jedna z wielu potrzebnych usług Wczytywanie, ekrany weryfikacji, obsługę błędów, mechanizmy ponawiania, eksporty do ERP
Platformy automatyzacji księgowości (AP) Rossum, Nanonets Działy finansowe, którym zależy na obiegach faktur w całości, a nie jedynie na wydobytych z nich pojedynczych polach Niewiele do budowy, jeśli ich system obiegu dobrze pokrywa się z Twoim
API parsujące tworzone z myślą o deweloperach Mindee, Veryfi, Parseur Inżynierowie, którzy w pełni kontrolują workflow dokumentów i potrzebują by wynik miał postać czystego pliku JSON Zależy od dostawcy. Parseur posiada własną aplikację recenzencką
Parsery dokumentów oparte natywnie na AI LlamaParse, Reducto RAG i agenci AI potrzebujący wiernego odwzorowania struktury bardziej niż poszczególnych pól biznesowych Mapowanie pól, walidację i wszystko, co związane z tworzeniem workflowu
Pakiety IDP dla korporacji ABBYY, Hyperscience, UiPath Duże firmy z rygorystycznymi regulacjami, operacjami wymagającymi weryfikacji manualnej i starszymi systemami (legacy) Niewiele, praca przenosi się na wielomiesięczną konfigurację i wdrożenie systemu

Dwa zastrzeżenia do tej tabeli. Po pierwsze, rzędy się przenikają: część dostawców należy do dwóch z nich. Po drugie, Parseur leży w trzecim wierszu, ponieważ do tego właśnie został stworzony - zamiana e-maili i dokumentów operacyjnych na strukturalnego JSON-a za pomocą aplikacji, z którą Twój zespół operacyjny sobie bez problemu poradzi. Jeśli Twoje dokumenty to np. rysunki inżynieryjne, to rząd czwarty będzie dużo lepszym wyborem, i wolimy Ci to uświadomić teraz, a nie dopiero w trakcie okresu próbnego.

Ekstrakcja oparta na szablonach a ekstrakcja oparta na AI (tylko jedna z nich się skaluje)

Ekstrakcja oparta na szablonach znajduje pole na podstawie jego pozycji na stronie. Ekstrakcja z użyciem sztucznej inteligencji znajduje je na podstawie jego znaczenia. To cała różnica i właśnie od niej zależy, jak wiele pracy weźmiesz sobie na barki.

Szablon działa tak: numer faktury znajduje się 40 mm od góry i 120 mm od lewej. Jest szybki, deterministyczny, znakomity. Do czasu, aż pewnego ranka jeden z dostawców odświeży wygląd swojego rachunku, a oprogramowanie zwróci Ci wtedy niewłaściwą wartość lub nie zwróci jej wcale, a w systemie pojawi się nowe zgłoszenie. Dwustu dostawców, to dwieście szablonów i jeden inżynier, który potrafi to opanować.

Ekstrakcja oparta na sztucznej inteligencji analizuje dokument dokładnie w ten sam sposób co człowiek. Rozpoznaje całkowitą wartość faktury, bo ta widnieje pod linią z napisem "Do zapłaty", jest w prawym dolnym rogu, sformatowano ją jako walutę i zrównuje się z sumą wszystkich pozycji z góry. Nawet jak przesuniesz, zmienisz układ albo przetłumaczysz całą fakturę na język niemiecki - wciąż z powodzeniem to znajdzie.

Parseur nie używa szablonów, napędzają go dwa silniki sztucznej inteligencji: Silnik AI Tekstu dedykowany e-mailom i dokumentom tekstowym oraz Silnik AI Wizyjnej (Vision) przeznaczony skanom, PDF-om i obrazom. Opisujesz tylko te pola, których potrzebujesz, a system samodzielnie podchodzi do dokumentów ze zrozumieniem, a nie ze względu na ich wygląd. Oznacza to kilkuminutową konfigurację definicji pól, zamiast marnowania wielu tygodni na kreowanie i obsługę dedykowanych szablonów.

Ten kompromis to fakt. Ekstrakcja AI to metoda probabilistyczna, w przeciwieństwie do deterministycznego szablonu. Właśnie dlatego istnieją wyniki oceny pewności i dlaczego sekcja poświęcona wdrożeniu systemu przywiązuje w poniższym zestawieniu znacznie więcej uwagi obsłudze wyjątków niż samemu potwierdzaniu dokładności narzędzi.

Jak działa API do ekstrakcji dokumentów, w pięciu etapach

Dostawcy różnią się w szczegółach, ale we wszystkich rozwiązaniach struktura ekstrakcji dokumentów przebiega z reguły podobnie.

Dlaczego przestało to być opcjonalne: z powodu skali. Dream Factory cytuje dość powszechną prognozę, że globalne zbiory danych sięgną 175 zettabajtów do 2025 roku (data, którą mamy już za sobą), a odsetek dokumentów odbieranych w systemach, wcale w obliczu wierszy z tabelami relacyjnymi, nie spada. Manualne przypisywanie do systemu w ogóle się przy tym nie sprawdzi. Złożona matryca szablonów również tego nie uciągnie.

Krok 1: Wczytanie (Ingestion)

Nieważne, jak nazywają to poszczególni dostawcy – jest to API do wczytywania dokumentów: przez wysyłkę w protokole HTTP, forwarding w mailach czy przy użyciu webhooków wysyłanych z innego układu systemów. Przekazywanie e-mailowe ma jednak o wiele większą skalę, niż na pierwszy rzut oka mogłoby się wydawać. Sporo materiałów od dostawców omija dedykowane portale i ląduje bezpośrednio w firmowych skrzynkach, jako tradycyjne załączniki mailowe.

Krok 2: AI OCR i analiza układu

Silnik AI OCR błyskawicznie przerabia pliki graficzne i skany na czysty, gotowy do przetworzenia format znaków i tekstu maszynowego. Potem zaczyna działać inteligentny algorytm rozplanowywania, analizując kolejność elementów, bryły tekstowe, podziały słów, ich linie i weryfikując precyzyjnie ich układ na płaszczyźnie. To krok, po którym najprościej zweryfikować czy system działa w myśl technologii z 2010 czy 2020 roku: nowsze algorytmy wypuszczają całościową, odwzorowaną i poprawnie ułożoną mapę elementów, a nie wycinek samych, niezależnych od siebie wyrazów.

Krok 3: Parsowanie

  • Pary klucz-wartość: dopasowanie etykiet do przypisanych wartości np. "Numer faktury: 12345".
  • Tabele i pozycje (line items): rekonstrukcja spłaszczonych lub oddzielonych pozycjami wierszy komórek. Scalone bloki kolumn, w tym długie tabele przekraczające łamy pojedynczej zrzutki ekranu bądź nowej strony w formacie pliku.
  • Klasyfikacja: dedukcja formy dokumentu, by trafnie wymierzyć zapytania do konkretnych modeli parsowania i docelowych okien pól.

Krok 4: Post-processing

Daty, waluty oraz dane identyfikacyjne firm sprowadzone są tu do spójnego formatu wyjściowego. Przekonwertowany stan jest weryfikowany (i testowany poprawnie) z docelowym polem docelowym przez tzw. strukturę z modelem JSON Schema albo Pydantic, by uniemożliwić złemu pakietowi na zaistnienie i wyrządzenie defektu integracyjnego do ERP.

Krok 5: Dostarczenie

Ostatnia z faz procesu przekazująca na cel z powrotem dane do użytkownika końcowego – w małych wariantach pliku będzie ona natychmiastowa. Kiedy natomiast rozmiar przekracza określoną granicę, proces działa w tle i aktywizuje asynchroniczny "callback webhook", żeby po jego zwrocie odebrać zapytanie. Wyważona redundancja prób w połączeniu ze wsparciem metody idempotencyjnej zabezpieczają sprawnie cały system przed zawieszeniem działania, przy wyższych objętościowo danych. Wymagaj obu w trakcie podpisywania dostawów, a nie kiedy proces "zawiesi" system na pierwszy rzut weekendowego natłoku pracy w księgowości.

Pokaż mi JSON

Strony dostawców obiecują wiele, jeśli chodzi o kwestie tworzenia "ustrukturyzowanego kodu wyjścia", rzadko pokazując jego format wyjściowy w rzeczywistości. Tak właśnie powinna się kształtować prawidłowa interpretacja formatu faktury zwracanej dla procesów dostawcy:

{
  "document_type": "invoice",
  "supplier": { "name": "", "tax_id": "", "supplier_id": "" },
  "invoice": {
    "invoice_number": "",
    "invoice_date": "",
    "due_date": "",
    "currency": "",
    "po_number": ""
  },
  "amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
  "line_items": [
    {
      "description": "",
      "sku": "",
      "quantity": 0,
      "unit_price": 0,
      "line_total": 0
    }
  ],
  "confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}

O funkcjonalności tak sformułowanego zapisu stanowią tak naprawdę dwie jego kluczowe cechy. Opcja line_items operuje parametrem matrycy, a nie prostego opisu pola, tak aby dostarczyć oprogramowaniu ERP system sprawny do trójstronnego systemu uwierzytelniania księgowego (three-way-matching). confidence precyzuje dokładną zgodność wyciągniętą przez algorytm i zaufania parametru, by samodzielnie przesiać wartości i automatycznie odnieść te problematyczne (odrzucone systemowo przez próg błędu) do weryfikacji.

Jak wybrać API do ekstrakcji dokumentów, nie ufając demo

Checklist for evaluating a document extraction API on your own documents
Document Extraction API Checklist

Zawsze zakładaj jedno: w idealnie zaplanowanych scenariuszach wdrożeniowych na prezentacji handlowej narzędzie systemowe pokaże w stu procentach to, czego oczekują dostawcy oprogramowania. Z tego powodu powinieneś wdrożyć system we własnych, prawdziwych procesach obiegu dokumentów, po to, aby dostawcy oprogramowania nie mogli wybierać dla Ciebie próbki.

1. Zbuduj testowy zbiór plików zanim rozpoczniesz testy

Wydobądź ze zbioru archiwum swojego przedsiębiorstwa co najmniej 200 do 500 plików faktur zebranych z ostatnich trzech kwartałów (pamiętaj, aby układ pasował proporcjonalnie i dokładnie do tego, jak pracujesz):

  • ok. 70% typowych materiałów i wariantów form w fakturach, jakie powszechnie pojawiają się z regularnych firmowych zleceń.
  • ok. 20% specyficznych przykładów dostarczanych u Ciebie rzadko (np. co kwartał).
  • 10% najgorszej jakości skrajnych wypadków, jakie mogły się pojawić w firmie – niedoskonałe skany, dodatki pisma ręcznego (adnotacji), gorsze podziały stron lub np. dwie transze na jednym bloku dokumentu.

Przeprowadź kompletne działanie identycznie we wszystkich testowanych oprogramowaniach (z zachowaniem odpowiedniej proporcjonalności wytycznych we wspomnianej strukturze). Nigdy pod żadnym pozorem nie zgadzaj się na podesłanie bazy plików stworzonej po stronie narzędzia systemowego w ramach testowania.

2. Punktuj wybrane pola systemów a nie pojedyncze dokumenty

Globalne odrzucenia czy zafałszowania wyników przy pełnym procesie zacierają koszty awarii całego rzędu i uciszają oparte o to statystyki wewnątrz firmowego zestawu ustaleń błędów systemowych (tzw. bug reportu). Dlatego od dzisiaj bacznie wyceniaj ryzyko każdego błędnie uwzględnionego elementu oddzielnie i wytyczaj odpowiednią hierarchię priorytetów po analizie parametrów poszczególnych komórek:

Komórka Dlaczego jest ważna
Numer rachunkowy/faktury oraz ID przypisanego podmiotu gospodarczego dostawcy Przy braku właściwych procedur całe duplikowane pole systemu obiegu dokumentacji posypie się przez jedno odrzucenie
Wartości walut / sum ogólnych, oraz podatku VAT na dokumencie (VAT rate) Tutaj pomyłka spowoduje ucięcie albo nadpłatę, a za te ponoszone będą duże opłaty wyrównawcze z kasy firmy
Oznaczenia identyfikacyjne tzw. pole numeru zamówienia PO (purchase-order-number) Haczyk stanowiący pole bazowe w modelu zgodności na trzech poziomach w wariancie faktur (zabezpieczonym na fakturach za zlecenia)
Wskaźniki przy rozbiciach cen i pozycjach towarów Przestrzeń błędu systemowego (w którym z racji gorszych rozwiązań AI) ulega zafałszowaniu bądź podawany wynik wyrzuca awarię większej skali silnika oprogramowania
Pola dla datowania w formularzu Proste w wyrównywaniu w oparciu o modele LLM na mniejszych polach testowych z perspektywy post-procesowej, ale generują największe szkody pod względem błędu u człowieka weryfikującego pomyłki systemu API w księgowości manualnej

3. Jedyną i rzetelną rzeczą która się przy wdrożeniu opłaci, to bezwzględny współczynnik automatyzacji obiegu (straight-through processing)

Uściślając statystyki sprawdzasz ile dokumentów nie potknęło się i bez usterki wpadło do systemu – zero zaangażowania człowieka z działu finansowego, czy operacyjnego od początku do momentu udanego zapisania gotowego pliku ze wszystkimi zinterpretowanymi tabelami na dysk. Rozumowanie jest banalnie logiczne – różnica poziomu współczynnika błędu przy tysiącach wygenerowanych rocznie przesyłek potrafi wynieść setki załączników poprawianych przy zróżnicowanej architekturze firm dostawców miesięcznie do zweryfikowania (czyli w uproszczeniu, wzięciu odpowiedzialności za poprawianie tego całego błędu). A to przecież etat stanowiska, za który ostatecznie będziesz musiał systematycznie opłacać (albo nawet płacić kilku nowym pracownikom).

4. Pozycje (line items) to element, na którym systemy polegają

Uzupełnienie samych nagłówków systemowych będzie w skrócie rzeczą śmiesznie bezstresową. Praktycznie wszystkie nowoczesne warianty silników AI sprostają poprawnie numeracji na wierszu głównym faktur. Ale jeśli wygenerujesz zestaw bazy połączony i wymieszany układem na różnych łamach, ułożysz opisy wielowersjowo i rozproszysz podatkowe tabele – tylko po takim przebiegu sprawdzisz statystyki poprawności. I zanim je bezwarunkowo zaakceptujesz, wrzucisz to znów jeszcze mocniej przetasowane systemowo przed odczytem.

5. Sprawdź opcje wsparcia do naprawiania wyrzuconego błędu systemowego na dokumentach niestandardowych (tzw. "exceptions")

Zweryfikuj to za jednym zamachem: zapytaj o przestoje na przesyłach (wariant asynchronicznego pobierania), progi błędu, pakiety opóźnione / limity danych, opcje integracji pod "SDK", możliwości i stopień radzenia z wyjątkowo słabym, niewiarygodnym parametrem wejściowym AI OCR. Gdy za tym odpowiedź zwrotna padnie jako sugestia: "obsłużą to bez problemu twoi inżynierowie systemowi (po prostu zlecicie to po nowemu w zaktualizowanych API do przebudowy kodowania pod konkretne API we własnym oprogramowaniu na integracji)", oznacza to zazwyczaj potworną opłatę ukrytą. Pełna metryka danych API i wsparcia dedykowanego do zwalczania trudności Parseur ukryta jest dla developerów we wsparciu developerskim dołączonej dokumentacji dla kluczy API Parseur. Z kolei interfejs sieciowy, bez zrzucania poprawek w kolejną deweloperską zrzutkę (tzw. kolejny ticket do ugrania dla sprintów developerskich) daje tu absolutną swobodę.

Ile naprawdę kosztuje API do ekstrakcji dokumentów

Rzeczywisty kształt opłat ma mało wspólnego ze strategiami pokazywanymi najczęściej i promowanymi pod kątem zaufania przez speców od wdrożeń (marketingowców dostawców API):

  • Stawki pobierane od przelicznika pojedynczej zrzutki na nowej "skan-stronie": wygląda najpiękniej (czyli najtaniej) od strony małego i zbitego obrysem formularza (krótkich jednostronicowych deklaracji w firmie księgowości klienta docelowego / detalisty). Przeraża wręcz rachunkiem przy konieczności przetwarzania u dostawców usług B2B i ryczałtowych u których np. umowy kontraktowe u ubezpieczyciela posiadają ok. 50-70 stron dokumentów po rozbiciu z paczek archiwalnych (tzw. .ZIP w umowach rocznych spółek) do przerobienia przy identycznych do uzyskania pulach ok. tylko kilku parametrów informacyjnych we wszystkich połączonych archiwach z wierszami za zlecenia.
  • Od pojedynczego wydanego i zweryfikowanego pełnego załącznika: opłata wygląda na pierwszy rzut oka przewidywalnie, bo w rzutach jednostkowych daje bezproblemową pewność rachunku opłat przy mniejszych wolumenach firmowych na miesiąc. Jednak u "lepszych" lub po prostu chętniej sprzedających te pakiety do korporacyjnych umów programistów - w przypadku potrzeby analizy zapytań (często zaimplementowanej usługi Q&A w oprogramowaniu), specyficznych pism lub nawet zaimplementowanych i wyeksponowanych od zera rękopisów w bazach umów — usługa opłaty winduje rachunki kilkukrotnie w formie dołączanego w trakcie pakietów ryczałtowych dla usług (jako płatnych w standardzie premium-extra podłączanej dedykowanej opłaty do subskrypcji).
  • Subskrybowane plany po weryfikowanym w pełni z góry wyliczonym wolumenie firmowym: stałe, odgórnie sztywne ramy, co przekłada się idealnie (szczególnie, pod stabilny próg za opłaty miesięczne) przez co dla zrzutów po wielkiej, bardzo długiej np. na kilkadziesiąt stron i kilkunastoletniej umowie archiwum kontraktowego, zyskujesz stały budżet miesięczny o rozbitym marginesie pomyłki przy roszczeniach (w których to de facto opłata zawsze zostanie nienaruszona od ilości przewertowanych znaków tekstu od sztuki).

Od teraz powinieneś wziąć pod uwagę również inne opłaty ukryte: koszty czasu implementacji deweloperskiego środowiska w programie wewnętrznym w chmurach firmowych przedsiębiorstw, po tym jak API zwróci gotowe informacje (tj. kodowanie powiązanego u układzie logiki procesu docelowego), tworzenie odpowiedniego środowiska i graficznego widoku do podglądu (przeglądarkowego systemu nadzorującego i tzw. debuggera do wglądu w interfejs po zwróceniu przez serwer API nieprawidłowego rozbicia wartości od AI parsera) i przede wszystkim o utrzymaniu samej administracji monitoringu poprawności spływania plików (drift monitoring) przy stale modernizowanych przez dostawców ujęciach ustrukturyzowanych danych ich rachunków fakturowania z umów B2B (faktury o innej ramie pola dostawcy docelowego). Praca z Parseur po uruchomieniu aplikacji internetowej wymazuje wręcz w sposób genialny wszystkie powyższe przeszkody. Dostępne obecnie opcje ryczałtów pakietowych sprawdzisz na naszej oficjalnej platformie dla cenników.

Parsowanie PDF do JSON za pomocą API Parseur

Five steps from PDF upload to parsed JSON on your webhook
Parsing PDFs Using Parseur API

Cała ścieżka API dla ekstrakcji z PDF, od przesłania do webhooka, mieści się w pięciu zoptymalizowanych krokach.

Base URL: https://api.parseur.com/

1. Uwierzytelnij się

Znajdź swój klucz API w odpowiedniej zakładce dla deweloperów po zalogowaniu na koncie Parseur i zamieść go zawsze we właściwym, odpowiednio zdefiniowanym wierszu w sekcji Authorization we własnych zapytaniach serwerów przy przesyle danych systemowych:

Authorization: <YOUR_API_KEY>

Całą niezbędną wiedzę i odpowiednie instrukcje można odnaleźć w naszym udokumentowanym Katalogu uwierzytelniania API (Autoryzacji) dla klientów Parseur.

2. Utwórz lub zdefiniuj na nowo Mailbox

Skrzynka pocztowa (tzw. Mailbox) pełni formę nadrzędnego zbiornika bazowego z włączonymi systemami nadzorowania odczytu do zbierania (ustalonych wcześniej z poziomu interfejsu klienta dedykowanego) wszystkich zdeklarowanych w parametrach wartości parametrów we wszystkich połączonych i odebranych zrzutach archiwów plikowych/danych i wszystkich parametrów żądanych opcjonalnych zapytań z bazy danych firm do pobrania od dostawców faktur do formatu CSV lub do API:

curl -X GET "https://api.parseur.com/parser" \
  -H "Authorization: <YOUR_API_KEY>" \
  --compressed

Oznaczony w zapytaniu docelowo Mailbox ID ukazuje się od razu również na każdym poziomie po URL aplikacji przeglądarkowej dla okna (tzw. adresu URL poczty Mailbox u operatora do edycji online) po stronie aplikacji oraz jako oznaczone id parametr odpowiadający opcji dedykowanej dla odpowiedniego pakietu skrzynki u API do wywoływania żądania tworzenia tzw. "poświadczenia u API dla poczty docelowej" po kodzie JSONa przy przesyłach systemów serwera API Parseur dla każdego pobrania (GET) z powrotem.

3. Przesłanie pliku ze zwrotem zweryfikowanym

cURL:

curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
  -H "Authorization: <YOUR_API_KEY>" \
  -F "file=@./invoice.pdf" \
  --compressed

Python:

import requests

url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<YOUR_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Node.js:

import fetch from "node-fetch"
import fs from "fs"

const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<YOUR_API_KEY>" }

const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))

const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())

Pliki i załączniki do odpowiedniej zbiórki i wczytywania (skrzynki Mailbox w aplikacji i kontach Parseur API w ramach wczytywania dla chmury dokumentów poczty w panelu dewelopera i web) można też od biedy skonfigurować w 100% po prostu, wykorzystując wbudowany mechanizm automatycznego e-mail forwardingu poprzez reguły firmowej aplikacji używanej przez e-mail u klienta. Możesz doczytać detale konfiguracyjne pod hasłem dla dokumentacji systemowych o tytule u klienta wsparcia: Wczytywanie w trybie wirtualnym e-maili i przekierowań wprost na panel aplikacji Mailbox w panelu Parseur wsparciu (ang. Upload Emails and Documents) opisujące te ścieżki i powiązane rozwiązania API systematyzujące procesy w firmie (włączone procesy asynchroniczne i włączane asynchroniczne procesy i wczytywanie po API serwerów serwisy wspierane pod Parseur API u klienta i chmurowe na dedykowane na żądania dla użytkownika).

4. Przejmij dane po API i zaciągnij dla procesów systemów do pobrania plików wyeksportowanych

Załącz z powrotem dla Twojego środowiska testowego (czyli np. platform do uruchomienia programowania u siebie u systemów we wdrożeniach (np. webhook serwery)) w platformie, np. pod serwer API uruchamiane do integracji i ustawień API serweru docelowego serwisu tzw. "odbiorcy docelowych JSON dla żądania webhook" po koncie mailbox pod platformy deweloperów po skonfigurowanym webhook na panel klienta pod platformy deweloperów po API dla API po kontach wspieranych (skrzynka Mailbox po ujęciu webhook i u systemów klienta) — tuż po odebraniu potwierdzeń wykonanego wygenerowanego parsowanego do JSON procesu pod Twoje pole adresacji w adresacji u deweloperów. Jeśli chcesz to poprowadzić bezpiecznie (dla środowiska na użytek komercyjny we wszystkich rozwiązaniach produkcyjnych, zalecany parametr konfiguracyjny (ustawione na żądanie u klienta w oknach integracji w aplikacji)): oznacza on zniwelowane w 100% problemy na zgubieniach pakietów dokumentów wysyłanych po uśpieniach w asynchronicznych cron przy utracie procesowania na tzw. pollowaniu i problemie pobrań synchronicznych przy "zagubionych zapytaniach" przez asynchroniczny, sprawdzony mechanizm tzw. event listener (bez sprawdzających zapytań webhook-listener asynchronicznego).

Opcje powiązane (wymagające odświeżenia asynchronicznie integracji i API API w integracjach aplikacji na zapytania, tzw. na wywoływania API), np. jeśli sam system klienta z jakichś przyczyn jest pozbawiony, odcięcia opcji, braku i dla np. serwerów nie współpracujących u klienta API we wspomnianym asynchronicznym formacie integracji we wzajemnym na połączeniach we wsparciu (webhook na odczyty we wsparciu asynchronicznego wywoływania) we wsparciu dla webhook serwerów aplikacji u serwerów u aplikacji do wpięć deweloperskich po API na zapytaniach deweloperów:

  • Wbudowane opcje platform automatyzujących w API do wektorów (automatyczne pobrania): u takich rozwiązań, po platformy u webhook u dostawców firm wejściowych wsparć dla: Make (dawne integromat deweloperów we API), integracji i wtyczek u platform w systemach oprogramowań w Zapier po integracje w platformach u platform dla rozwiązań dla platform w n8n na platformy oraz Microsoft (jako narzędzie systemowe we wsparciu) pod tzw. system platform na u wejściowe systemów dla Power Automate na deweloperach po platformach w integracjach wsparć.
  • Opcjonalne tryby do wywoływania danych z serwerów i do tzw. zapytań systemowych we API serwerów, do testowego sprawdzeń tzw. Polling system i pollingów i zapytań po interfejs API: wywoływania i sprawdzenia (Polling i tzw. odczyt polling), przez parametr tzw. pobraniowe odwołania do sprawdzenia do pliku pod np. pobrań w GET /document/{id} i zapisach po w formacie w pod pobrań API u systemów w pod struktur w formach pod parsowanego pliku wynikowego dla systemów plików formatu pobranego po pobraniach.
  • Opcje eksportów we interfejs do zapisu do eksportów plików i u interfejs we API (pliki i opcje formatowe eksportowane u formaty plików pod pliki eksportowe na pliki i pliki): opcje po eksportach, w tym generowanie automatyczne eksportów pobrań we dla pakietów dla np. CSV (lub wsparcie form dla form pod eksportowe), lub np. pliki typu eksport we format np. u formatach Excel i w format we API eksport na tzw. JSON wyciągniętych ze środowisk plików platform docelowych po kontach platform dla platform do po pobrań pobranych w Mailbox i pobraniach do pliki u platform pobraniowych docelowych na formatach z okienek z Mailbox i na z u z plików pobrań z platform u pliki plików z Mailbox i.

5. Walidacja, konfiguracja procesowania plików w pobieraniu pod optymalne logi na platformach docelowych, walidacjach (i poprawy błędów pod API we panelach docelowych logowania po API na docelowych wsparcia log po panel u platform i dla docelowych u błędów plików z platform systemowych i dla we) i dostrajanie (optymalizacji u API)

Parseur za pomocą dedykowanych pod konta dla tzw. opcji wyświetlania po docelowych na logach u systemów u deweloperów u interfejs pod we system platform podglądu u docelowych plików na wyświetlania na log (plik log) na dashboard po pliku pod dashboard po log i webhook w webhook na pliku (logowanie) umożliwia szczegółowe zweryfikowanie z wyników z operacji, co tak właściwie dokładnie odebrało od nas narzędzie AI, żeby potem na log u system u we pliku od klienta do system na zapytania, zostało przekazane i dostarczone z log. Kiedy tylko jakieś konkretne na system pod API, pojedyncze okienko z parametrem informacyjnym czy okienko we dla we docelowych w docelowych po np. z zapytaniach bazy i bazy w (dane na plik okienku do baza, okienka na pliku we) ze z pola w API na we API wraca system z wynikiem po wyników jako dane we jako (na wyniku docelowym po jako wartość pod wartość) ewidentnie we ewidentnym po u błędy jako błąd jako błąd (tzw. zwrotem źle rozbite na na na źle z błędy na na błędnie z jako u źle), wystarczy wprowadzić w tejże u okienka okienko panelu drobną do pod (drobnych we na system od interfejs aplikacji pod tzw. drobną system i od panelu interfejs) poprawkę naprawczą bezpośrednio, i u na we i na w okienko zamiast z opcji po system pod na od okienko marnować bezwzględnie swój po z swój w po zapytania u system w marnować we czas system po na tworzenie u w pod tzw. obejścia jako w u do we we z problem we oprogramowania kod we w.

Co Parseur potrafi wyodrębnić, a czego jeszcze nie

Parseur to rozwiązanie opierające się ściśle u podstawy we na koncepcji: oprogramowanie API nie wymaga od klienta rygorystycznego przygotowywania plików od podstaw do na pliku zanim API przystąpi do pierwszego czytania i wydobywania zapytania na wywoływania u system z zapytania o dane w w z plików po pliki u dokumentach dla dokumentach dokument w z dokumentu dokument na API dokument we system w z dokument z. Od roku 2016 po API, Parseur po z powodzeniem przetworzył pomyślnie grubo ponad 100 000 000 od i na w system od we u na plików API plików i plików we na pliki.

  • Pary klucz-wartość (KVP) i klasyczne na w system do we w formaty dokument dokument po w dokument w u z na formularze formularze w (tzw. forms w z i formularz): takie dane jak z dokument formularz do z system z u w dla we imiona (na system do imiona, nazwiska imiona), pełne na do po z u pełne z u w we (adres adres w np. u adres i adres), sumy u w po sumy sumy do po i na na u i (ogólne), na u i po numery rachunków od i po u w numery w u do od (na z numer i numer rachunek np. we faktura, u z np. faktura po numer z), a pod referencyjne do z w dla u i z (do w np. identyfikatory ID we np. ID w ID po we np. ID dla ID u np. z ID po), zapisane na we w dla i spakowane u dla od jako za do pod we dla etykietowane w we po z i z w i z w (na dla w z np. w system dla w do na np. etykietowane etykietowane we w w na pola we).
  • Tabele we system po do (tables u we do u) i do po w w po dla w u we na dla (line items do we u) dla po w po na u i na system do z (po z z do z np. tzw. we po line items od we i np. do np. u i z pozycja po od np. i pozycja): m.in. dla u i w np. u w z do na do po do dla po w dla w z z po i w u do na po w (np. system np. pod w pod od faktury w do od na np. na np. dla u dla z u we i faktury dla w i w np. faktury w na), i u do u we z we i u do po we u po do wyciągi wyciągi i na z w po np. z do do w dla po w (do w np. i we dla na w np. z do np. np. u wyciągi dla np. we od i w dla wyciągi pod wyciągi u od), tabele u np. w po do dla dla na od z w i z po u na do u u np. (u np. i w np. manifesty z np. manifestów), a w do i np. to z i po w we i pod na (po np. np. dla np. u u dla np. u to i we w na i pod w do to u i na również we w u w dla w również na w u również i u na do i do również również dla również po również w dla od) uwzględniając od w i dla dla we u na np. tabele u od np. i np. na z (pod w i z i u pod w od np. pod w pod i na z tabele po we wielostronicowe po np. np. dla w do wielostronicowe na w wielostronicowe we po). Instrukcja dla ekstrakcji tabel w oparciu o modele AI do po w do w we (AI table extraction na dla i po dla od u w u w do dla we na po na po od dla na od na we do z we dla po do na we od z we w po na w po od po od po do w od po we po we na do do u od we na u u i) pokrywa od na na z na dla po od z u od na w (pokrywa dla po na po u po po we na na pod z na z dla dla po z po u u u na w z do z u na we z we po i do dla u do po we).
  • Skan z we po dla z we i po (w po od dla na skan z na skan po w z u we z na od do pod do we z od i do we dla we do) i dokumenty sfotografowane (z i pod od u z na do dla i u w do u po dla pod fotografowane od na u u do fotografowane i po po i po z po): dedykowany do we u od w do (u do we do od w do od w i u dla dla u we dla na do z) silnik do od u od i w u (silnik pod od do u z na w w z we u z na we we pod pod po do z we na dla na dla na i w i) oznaczony jako od we po od u od w do (Vision AI po w na dla po do w na w na we dla i we u do we z u pod od w pod pod) perfekcyjnie w po pod do od do w po na na do pod do we we (w we po w we po i po u u po po) analizuje we na u dla na po (we u od do do od po u i do u dla w we od dla pod pod i) materiały z i na po od dla i dla na i pod na u z u w w od na dla (z w od z we od po od w z po od do od po do od we od) np. we z we pod we w we u z w (dokument pod w i na pod na pod na do we do we i z do na na na po u) skan i do na dla na od u z we i z (pod dla po we na u we w od u dla dla w do na dla pod pod) zdjęcia, i do z od od po na (u w po z w na do do dla u na) operując od z u po po do na na do po pod na dla we (od z pod na we do we we na po w z dla dla po) nie u we do u do na od na we dla dla z we do na po we po w na po u we od do i od w (nie w do do i po pod pod po od pod dla dla pod z i z pod we pod we) tylko i po na do pod po pod na do u w z dla w dla i w do po (u po z w na do po pod na i z dla we pod u do we we) na na pod pod na pod pod dla (pod na u u dla i dla od do we pod na dla u) we od z od i dla po w na i na do we do (w i na w na w od pod po do we do we i z pod po na i dla do do po we po do we pod po do i do w) cyfrowym na do w po do na (od na pod dla w do pod z we do pod) standardzie z pod dla i w po na (z od u po pod pod po) generowanym do na do dla i na na po w z do we pod na po na w w od w (we po po u po u od w we we po pod z u po po w pod pod po).
  • Korespondencja od w od z do od od dla z w do i dla do dla w do po pod i we w (korespondencja we na i po po na e-mail z u e-mail u dla na we w z e-mail i do po we od w) i z po i pod w u na od do (na dla od we do pod pod pod na po do po pod) jej z u do we na od u w i od dla na po do (od dla pod dla pod dla pod dla pod dla po od od pod w od pod pod pod z od) we i załączniki w na od do we pod i w i (do od od w pod dla od pod załączniki na w załączniki na we z po i po dla pod dla pod pod pod): mocny, w w od pod dla dla we od od i pod pod do we dla pod pod we pod dla u we w dla od dla do na z (od pod dla pod po po w po po na i pod po po po pod po po po) doceniany u we na do i od w do pod do i do i do do we od na we pod od od na u pod od na we we w (u u na we we na do w do we pod i u do w pod dla do pod pod pod we we do dla na do na we we po do do we do we w dla do na) i (do do dla po w i z pod u dla) flagowy na u w do (flagowy we i na z na do we pod po na) punkt w dla (punkt u po od od od pod po po po po i we u u we od w od) Parseur pod od do dla po pod na z (do pod we pod z u pod pod od do na we w pod pod pod z). Każda do i we z i z dla na we (do i we po z i z dla we) wiadomość z na po na po od od na na od we po na w w z po u pod dla od pod na we na pod we w od po we po we (wiadomość z od pod po i i pod od) odebrana u pod od u (we na) przez do po po u w u w (we) system na (po na do) poczty w dla (we) traktowana do do pod (jest od pod dla u) jako u u (na od z pod od we do) równorzędny z w po na w od do (na z dla z w do w) materiał do do pod do pod (dokument na do) źródłowy dla pod po w pod w do na u na w u na w pod w do na (pod z u u od do pod do do), a we z w w dla pod (w do we z pod we od w dla od) wraz do po na w dla do po po u (z do do z we we z po od po pod od na) nią na z pod we do po (każdy od dla po do w dla) pod u w po do w u (z od dla we) załącznik pod u do w na z do we (dołączony po po u z do) do do do po po w z (od we od) jej z na w u dla po po w na od do we po u z w po na po do we u z pod (z pod u pod od z z pod z u z na od we u do do po w po od).
  • Skomplikowane i dla u po na u na do po do od do w pod z dla do u (elementy po dla do w pod pod dla) z od we pod z z po do dla z we i po z do dla z dla i we we dla pod u po (układ w po po od we z u u dla u) dla z po od dla do dla dla od do z i we po u po do od od w i od dla na i u u na w w (z u u u we we we we pod we od po we z w po od): u i do na od od (nagłówki na do i u na do na), u na z dla na na do na na od dla pod od od i u w z po we w we pod we od do (w od od po od dla we) we na i (dla we) z po na dla po do do od w u i u od we w we we dla dla we pod (akapity do we po we w do) po we i do na (dla u) oraz u w od od (dla z) opcjonalne po z (oznaczenia w pod we w w we) do (we w do do na do we we) tzw z we w od w na u u u od pod od z z we dla po pod we we (dla na z dla) dla w w w we we we po na po po u do we (tzw w do we i) dla u pod na z z po po we pod we pod we do pod w pod z (z u od we od) dla do od u po w pod u we (tzw z do u do we od od we) wyborów we na od od (checkboxes do z) do do (do z po po w do u dla z dla).

Czego jeszcze z natury ten typ API nie jest w stanie zagwarantować i to rodzi uzasadnione pod na na z po po od do (dla po) pod u do z u (u u w i we z u do u we i od w na z dla u we z i) na do do po na i do (dla pod dla) problem dla z do i w u w dla we po do we pod (problem u pod do): intensywnego dla u dla we pod na w u po i (zagęszczonego do w po z po) od w w na u od dla dla u do po z we u po do we do we pod na od i po we z u pod od w pod pod pod z pod (z i pod od w) i z od na i dla i do w w od u po z pod pod w na do pod od na od do na pod (z) z we z do po do pod pod po w po (pod w z po u do) na w po do i (ręcznego po po u na u od od do do pod we do) pisma u i od z u dla po po na u po po pod (u pod w po po na u u u u u we) i i w (od do u do u do) do u (z u na w pod w do we od dla) oraz do u w do pod dla pod u u po (we i we) dla na (z u) zamaszystych u z w na pod (do do u w do od) podpisów z pod (od od). Niestety we na po na po od we (we dla pod u) takie do we pod pod od we we (od u u pod u we na pod z u po od po) do we i do na od na (bariery we dla pod we na pod) na i (u u) do (z w pod z) są dla u i od od po (we w od do na w) nierozwiązane z z we na u (w we dla po od) po i (od w w) całej do po z we z z pod (w od we w u z) i u dla i od dla na na u (w we) we i u we we na do w do u w i u od (branży z i po po po u). Od we w w do po z w z u do z u u we u u pod po po (Więc z u na od po po u w) na i z po do we pod po u do we do pod po (jeśli do po po we od we pod pod po) i po do u (w z do po na) jakikolwiek u od w we we w w u we z u od po (dostawca we we we na we dla w) od we po (twierdzi w dla) dla (we do pod) dla na i u na do i do na (z we po od do pod we) we po we po we od do we do do od we pod po (inaczej u od z z do po w po we na w od na od w u z do po po we we), na na (to we) z (od) i (we) do po u od w u na od we na do we (poproś we od z we w od do po z dla dla z i dla) go u z po w po z na u we od po pod po od do dla w z do na od u w na w po dla z dla na na pod po po po u pod u do z do w od po u (we po) w i na od we z na u po na (po w we u po po u u w we u u u po we u) o po od z do od we (na po na na we we) u z na pod na w u po i z do we na na od po we na we pod po na (pokazanie w pod z z we od na) na w w pod pod na (benchmarku po dla po do od).

Większość z na w z (z i u na) od dla w (z u u u z z) dostępnych po u od z u po dla we od we u od we w do dla w w w i w w we u we pod z i w do od do u u (w we dla) u i w z i (rozwiązań z we z w u dla u) od w od od dla z u po dla po u po w u do pod na na po od dla i pod na (kończy we do w od we we we na u u po od) u (w od dla z u z dla) we dla do od od pod dla (swoją w we z z i z w po po) dla we z i na u pod na z po od z po (rolę i pod po w u od u od od z) i z na po z pod w pod (na z z w po w pod w od) API w i (i w po z dla) pozostawia w do do pod u z pod w na od dla na w na w od pod pod u (do po po pod) na z w w na (z we pod pod na od po) resztę po do po w na po po na i pod po po po pod po po pod na (dla we we) pod w pod (Ciebie w na). Do (W pod na po w pod od na od w po we do) w od w w z pod (z pod dla z) kolei od od na u pod od na (we od z) po od dla w u na we pod (w na na na na w) i we po (Parseur po do) dostarcza od na i dla i na (we z u do od) i u w (u z) w (w po) ręce (od na do od na) na do we pod z pod po na i dla (od na do pod po) użytkownika (w od we we w do do na do od) obydwie pod na od dla i do na (od po po i dla) we (od po po we) połowy do we pod pod u od z po dla po pod na na do w pod u we na (u z z w): z od i od i u od pod do od we (dedykowane z dla) dla w po na u we u u z u i po (we od od) API na w (po u po) oraz w na (z od w we u w w w u z od i) pod dla do po po w dla dla dla pod po w we od od do po pod u po dla dla od do z u w i u we we pod i we po dla i w i (platformę na w) webową u u od we w we we w u na po i u z (po po z od) (u w u we we u na z do od we w) w do po u w w w z u pod w we dla u do (z od od we od pod pod do we) na we w pod pod w u i (od dla w do u do w pod pod we po we pod pod do u do) do (w na na pod pod po po do pod pod u) z (z we po we na z od do dla we od z z do we od) od we z i u dla od pod po w (u we od od pod pod we po pod) której we w na dla (dla we na) cały od do (od po we) w od we do u (u do) dział na we (na od u) na i i (z do z w we i w w dla we po do po) operacyjny od do (od u do z we do we pod po do w z pod po po z od) po do (po pod na pod po we) w od na z do na we w pod (samodzielnie od po u we z u do u we z od na i u na po u we od u z z na u do na od od z z do u od na od w od i) i do od dla w na pod od do (bez we pod na z do i od dla dla od dla po) na u z w dla po na dla z z we po we do i w po pod dla z i w (czekania na na do do pod pod we) na po (we z) na i z po od pod od i i u (od u) kolejny pod u dla we po na (od od w na na pod z do we) sprint we od z pod od (we dla) na od do od od i w do po (z od we od) ze w we u u po u pod od u (od pod po we z od) strony po po w od u pod pod dla od u pod we u (w z z we do z pod po do we) IT u w dla (we dla od w po po na i pod do do), we dla (we we u od w do we) w od (definiuje na) na i i na z we od do z na na u (od na we na) pola na w pod dla w dla i w do po po w na pod po pod pod na do u u dla we we (we z) dla i u w do po dla dla w do po pod we do i u (do od we u we) ekstrakcji od z po do we pod (u od u z) we w w z u od po (na z na) w (i na na w w w w i w w we u we) biegu dla w we do we pod (do w pod we), u pod z z od w na pod (we) sprawdza z do na (w w we) po z po (dokumenty do u pod i) w w u (w do) i do na u w we w z z dla pod u (od pod) i z z do w do w po w pod od (do od dla w od od z pod pod pod po) koryguje do pod we (od od dla u pod we pod we do pod) ewentualne od pod od we pod z u pod od z od (od u) we w pod w po u od u (po we pod w po) błędy i po do w (dla po dla pod).

Gdzie i od po do i i przez po pod we i w (z na u w po od u od z pod pod i od do po) kogo u na u z po (we z we do pod w na w we na pod u do po i od) jest u we od po pod po od (do po) do od pod we w we do we pod na od od (u z) w pod z pod u w (dla u i po po pod do pod u od od pod we z) u na na po w na na dla we od na dla od dla i z na (od po po u u we we we we pod we od po we z w po od):

  • Działy od we na i po po na e-mail z u e-mail u dla na we w z e-mail (od do po pod po pod) z w we we od dla od z u we na na z z i na (zobowiązań do po we z do we u od od pod dla pod we na pod) - dla na na we i od na (na od w u na od) w i u we w u i (faktury we z u we w na w), od do (dla od na z) od pod we pod od i na od i z i w od (paragony z do) na i od i na od na na od we po (we i) od i (zamówienia z na w od i pod po u do pod we od pod w) od z po (do po z z z do z do) na dla i u do i we i we dla w dla z do u w po do od (JSON do we od u i pod i), w od w od od i na w (a w do w dla we) pod w pod i od we po (po z od) u do we dla dla do po na we po na w po od (od na do do pod pod we pod we do we od i z w) tym na w od pod po pod u i od od do po pod do pod u i na dla i (na z we) do dla z do (prosto i we z z na od od we u we w w i i po na po) pod we u od i z w w (do w na na w na w we od) po dla po dla od pod u na na do pod (od do po do pod pod po z) ERP od po w pod pod po (w po u u po do we pod po u).
  • Finanse od i (od i u we w u i do we w) po i do i dla i z (i po pod od pod u pod) we u we od z do pod po u (operacje do we od w u pod we pod) we od i do w od z w z do w we z do u z u we pod dla (finansowe we u z do) - po i dla z z pod we (wyciągi z w dla i) po po z z z i w i do we po do pod we dla u we pod do w (z w dla w dla w) do do we pod do od od u (bankowe dla pod do po we z po na u po w od od) po po dla dla do na dla na od (i po na pod) we i z na z we w we dla po we po z i z do (raporty z na i po we u) pod i pod po u po i w na z w i w w u z do (z i w) na z dla do po do od na od do we pod po na (transakcji od we na z po pod dla po) pod we na z od we pod z po u (do i na u) CSV na u na we z po na pod po (lub dla we u do) we na na na we po w (w do u dla z dla i z po do od i i po u u dla w) po dla po w do na od od do dla u i u z u w w po z pod na z (JSON z i) od z pod od dla po w pod z u (na u po na po pod na na pod) na i (potrzeby po na) po dla do dla po z po (do we na z z we w) u dla (w) dla dla u u (na od z na pod od we w we we we u z we w dla na u w z u we u) na dla od w od w (u w w i pod do po dla u z z po po z na w z pod we od w do od).
  • Logistyka na i po po na e-mail z u e-mail (od po) i na we (we pod i od) od pod po po po pod po po i (operacje na i) - na po (na) do do po od na (dla we u w po pod od po) od z (z do po od u) po od dla w u od po w w u (po w we u po i od po pod pod na do po z pod u od u) po i na we po z w po z od we u u do z (od do z we we z po od po pod od) i do we w (do w w i) po w na u dla we na z do na (od w pod od).
  • Automatyzacja do i z do u na na z dla do po po w z (z dla na po u po po we w od we) we i u (dla do we z po po) e-mail we z pod od na od w po (dla w) po dla (od) i w pod do dla w do po pod i we w i (od) z pod dla z i w (po po po pod po po i po z w na do do dla u na od we na od dla od u we pod z po od i u u) - u na od od pod na od po (po na w u po pod pod po od i pod pod do we) na pod z w w (do pod od i pod) do dla na od od (po po u u w we u u u po we u pod i i z i i od po z i u na od w do po na z do z od po z do u na na do pod od na od do na pod po i po i z od na i dla i do w w w).

Bezpieczeństwo, RODO i rezydencja danych w UE

Parseur jest hostowany w UE: dane klientów są przetwarzane i przechowywane w granicach Unii Europejskiej, a obsługujące je centrum danych posiada certyfikat ISO 27001. To jest twarde zobowiązanie do rezydencji danych, co jest inną i znacznie silniejszą rzeczą niż zwykła odznaka zgodności z RODO.

Parseur jest zgodny z wymaganiami unijnego RODO, brytyjskiego GDPR, kalifornijskich regulacji CCPA/CPRA i singapurskiego PDPA. Co najważniejsze: dokumenty naszych klientów nigdy nie są wykorzystywane do trenowania modeli AI Parseur i nigdy nie są sprzedawane na zewnątrz. Reguły retencji w systemie są całkowicie konfigurowalne, dzięki czemu dokumenty mogą być usuwane automatycznie w ustalonym przez Ciebie przedziale czasowym. Aktualnie jesteśmy w trakcie wdrażania programów zgodności SOC 2 Type II oraz HIPAA, co oznacza, że żaden z nich nie jest na dzień dzisiejszy formalnie certyfikowany.

Jeżeli lokalizacja danych jest twardym wymogiem w Twojej firmie, nigdy nie przyjmuj obietnicy „Hostowane w UE” bez zapytania o to, gdzie dokładnie odbywają się te cztery konkretne procesy: wnioskowanie z zapytań (inference), utrzymywanie tymczasowej pamięci podręcznej (cache), tworzenie kopii zapasowych i generowanie logów zawierających bezpośrednie treści z dokumentów. Europejska baza danych stojąca na zapleczu amerykańskiego punktu przetwarzającego endpoint to nie jest europejska rezydencja danych, a jest to niestety niezwykle powszechny model rynkowy. Nasze 12 pytań, które zweryfikują obietnicę nietrenowania modeli (no-training claim) pozwala na przeprowadzenie identycznego audytu na deklaracjach o trenowaniu modeli sztucznej inteligencji.

API do ekstrakcji dokumentów a modele LLM: Nigdy nie przekazuj surowego PDF-a

Modele językowe są fenomenalne w prowadzeniu analizy i całkowicie zawodne przy precyzyjnym czytaniu plików PDF. Wyceluj jeden z nich w zeskanowaną fakturę, a ten z pełnym spokojem zwróci Ci sumę całkowitą, której absolutnie nie ma na stronie. Od budowania poprawnej podstawy i uzyskiwania tzw. twardych danych podstawowych (ground truth) są API do ekstrakcji dokumentów. Dopiero na tej podstawie może zacząć działać model w wyższej warstwie logicznej.

Ten podział obowiązków, który sprawdza się w praktyce, działa tak: API ekstrakcyjne bezbłędnie wyciąga numery rachunków, daty, kwoty i listę pozycji wraz z pewnością odczytu, a dopiero potem LLM zaczyna robić rzeczy, w których modele językowe brylują, mianowicie transformować zrzucony wynik "01/03/25" w pełny format ISO 2025-03-01, naklejać metrykę klasyfikującą typ przesyłki czy poprawnie przydzielać elementy według słownika w Twojej architekturze wewnętrznej. Walidacja formatem (np. JSON Schema) powinna znajdować się u samych podstaw obydwu warstw i zatrzymywać wadliwe przesyły, których żadna z nich by samodzielnie nie wyłapała.

Na tej samej dyscyplinie musi opierać się budowa każdego bota i agenta AI. Mechanizm potrafi działać tylko na tyle skutecznie, na ile poprawnie i starannie przygotowano dla niego pakiet informacyjny – pamiętaj, że pojedynczy wyhalucynowany w systemie wiersz pozycji na fakturze natychmiastowo przekształca się w absolutnie prawdziwe zlecenie obciążone autentycznym przelewem bankowym w tle. Jeśli szukasz szerszej perspektywy we wszystkich aspektach integracji interfejsów do automatyzacji w przedsiębiorstwie, zapoznaj się z kompletnym poradnikiem dla API ekstrakcyjnych do strukturyzowania danych (data extraction API), na którym opiera się cały przekaz tej publikacji.

A teraz sprawdź wytrzymałość dostawców

Najlepsze API do ekstrakcji dokumentów na świecie wcale nie objawi się poprzez najdłuższą listę funkcjonalności w swoim menu – to będzie rozwiązanie, które najsprawniej poradzi sobie na Twoich własnych najgorszych, potarganych w obiegu, skomplikowanych i problematycznych procesach (na tych 10% najbrzydszych dla systemów odczytu fakturach), potrafiąc to zrobić z całkowitym pominięciem wsparcia ludzkiego w pętli decyzyjnej. Odrobina cierpliwości przy samodzielnym tworzeniu wewnętrznego środowiska testów i weryfikacja na konkretnych polach parametrów decyzyjnych (od których na produkcji tak naprawdę będą uciekały Ci pieniądze z kasy firmy, kiedy system na produkcji przestanie trafiać) da Ci jedyną wiarygodną odpowiedź przy liczeniu odsetka plików przerobionych bezbłędnie i czysto przez wdrożony, na ślepo puszczony w obieg strumień w tle. Zweryfikuj ten strumień na nas w każdej chwili, według zaleceń i wytycznych testowych o których przed chwilą czytałeś.

Cała reszta przed tym testem to po prostu kolejne puste pakiety ulotek systemowych z tabelą parametrów technicznych.

Utwórz darmowe konto
Oszczędzaj czas i wysiłek z Parseur. Automatyzuj swoje dokumenty.

Ostatnia aktualizacja

Rozpocznij

Zautomatyzuj ekstrakcję danych
z dokumentów już dziś

Załóż konto za darmo w kilka minut i zobacz, jak Parseur wpasowuje się w Twój proces.

Bez trenowania modeli AI
Działa od razu na Twoich dokumentach
Od prostego eksportu po pełne API

Najczęściej zadawane pytania

Pytania, które inżynierowie faktycznie zadają między pierwszym wywołaniem API a wdrożeniem na produkcję.

Typowy pipeline składa się z pięciu etapów: wczytywania, AI OCR i analizy układu, parsowania par klucz-wartość i tabel, post-processingu w celu normalizacji i walidacji oraz ustrukturyzowanego dostarczania danych przez webhook lub eksport. Nowoczesne API wykonują wszystkie pięć etapów automatycznie, bez konieczności wcześniejszego tworzenia szablonów.

Ekstrakcja oparta na szablonach dopasowuje pola na podstawie ich pozycji, więc działa do momentu, aż dostawca nie przesunie kwoty całkowitej o dwa centymetry w lewo. Ekstrakcja oparta na sztucznej inteligencji odczytuje dokument tak jak człowiek, identyfikując kwotę na podstawie jej otoczenia, a nie konkretnego miejsca. Praktyczna różnica widoczna jest w dłuższej perspektywie: szablony wymagają osobnej konfiguracji dla każdego układu, z kolei ekstrakcja AI radzi sobie z układami, których wcześniej nie widziała.

Zbierz od 200 do 500 rzeczywistych dokumentów ze swojej firmy w takich samych proporcjach, w jakich faktycznie do Ciebie spływają: około 70% popularnych formatów, 20% rzadziej spotykanych układów dostawców i 10% naprawdę trudnych, specyficznych przypadków. Przeprowadź identyczny test na każdym kandydacie i oceniaj ich punktowo pole po polu, a nie dokument po dokumencie. Nigdy nie pozwól dostawcy samodzielnie wybierać próbki testowej.

Zbuduj własny, jeśli Twoich dokumentów jest niewiele, mają stabilny układ i są generowane maszynowo. Kup API w momencie, gdy układy zaczną się od siebie różnić, ponieważ koszt nie leży po stronie samego parsera, ale jego utrzymania. Każdy nowy format dokumentu od dostawcy staje się zgłoszeniem błędu, a inżynier, który to napisał, staje się jedyną osobą, która umie go naprawić.

Pierwsze pomyślne wywołanie API to kwestia jednego popołudnia. Wdrożenie na produkcję to cała reszta: schemat pól, obsługa wyjątków w przypadku niskiej pewności oraz wyznaczenie kogoś, kto zajmie się webhookiem, gdy ten przestanie działać o 2:00 w nocy. Narzędzia oparte na szablonach dodają do tego jedną nową konfigurację dla każdego układu, co potrafi zamienić dwutygodniowy projekt w taki trwający pół roku. Proś każdego dostawcę o harmonogram uwzględniający etap przeglądu, a nie tylko zdobycie pierwszej odpowiedzi 200.

Tak. Przetwarzanie asynchroniczne, webhooki, ponawianie prób i operacje wsadowe (batch processing) sprawiają, że tysiące dokumentów dziennie to rutyna. Ograniczeniem przy takiej skali rzadko jest sama przepustowość — częściej jest to wskaźnik wyjątków, a to staje się kwestią potrzeby większego zatrudnienia, a nie infrastruktury.

API ekstrakcyjne dostarcza twardych danych podstawowych (ground truth), a model LLM na ich podstawie przeprowadza analizę. Podrzucenie modelowi językowemu surowego PDF-a często powoduje zagubienie się AI w jego układzie i tworzenie zmyślonych wartości. Jeśli najpierw wyodrębnisz uporządkowane pola, a później pozwolisz na ich znormalizowanie, sklasyfikowanie lub wzbogacenie przez model sztucznej inteligencji, agent dostanie wiarygodne materiały, z którymi będzie mógł bezpiecznie działać.

Zadawaj to pytanie i pytaj o dokładne warunki. Parseur nigdy nie wykorzystuje danych klientów do trenowania swoich modeli i nigdy ich nie sprzedaje. Wiele platform obiecuje w regulaminach, że nie używają danych do treningu, a jednocześnie zastrzegają sobie prawo do trenowania modeli na anonimowych lub zagregowanych wersjach tych samych dokumentów. Upewnij się, że ten wyjątek jest wyraźnie opisany i wyłączony w umowie.

OCR odpowiada na pytanie "jakie znaki znajdują się na tej stronie". API do ekstrakcji dokumentów odpowiada na pytanie "które wartości mają znaczenie i jak są ze sobą powiązane". OCR dostarcza ścianę tekstu bez struktury, więc nadal musisz napisać logikę, która znajdzie numer faktury. API ekstrakcyjne zwraca etykietowane pola, tabele z pozycjami wierszy, które możesz zapisać prosto do bazy danych.

Dobre API to robią, i to ma większe znaczenie niż ogólna "dokładność" podawana w nagłówkach. Wynik pewności na poziomie konkretnego pola pozwala automatycznie zatwierdzać te 90%, które są poprawne, a resztę kierować do weryfikacji przez człowieka. Dostawca z 92% dokładnością i dobrze skalibrowanymi wynikami pewności jest bezpieczniejszy na produkcji niż ten, który twierdzi, że ma 97%, ale zawodzi po cichu.

To punkt, w którym większość narzędzi polega, więc przetestuj to w pierwszej kolejności. Wielostronicowa tabela wymaga od API rozpoznania powtarzającego się wiersza nagłówka, przeniesienia mapowania kolumn przez granicę strony i niezaliczenia sumy częściowej jako kolejnej pozycji na fakturze. Pola nagłówkowe, takie jak numer faktury i kwota całkowita, są w porównaniu do tego proste, więc demo pokazujące tylko takie dane niewiele wnosi.

Zdominowały trzy modele rozliczeń: za stronę, za dokument oraz zryczałtowana subskrypcja na podstawie wolumenu. Ceny za stronę wyglądają najtaniej, dopóki nie wpłynie do Ciebie 40-stronicowa umowa. Z kolei funkcje premium, takie jak niestandardowe modele czy ekstrakcja oparta na zapytaniach, są często rozliczane osobno. Parseur pobiera stałą subskrypcję w oparciu o wolumen dokumentów, dzięki czemu długi i krótki PDF kosztują tyle samo.

Każde API obsługujące duże wolumeny danych powinno mieć taką funkcję. Duże pliki są kolejkowane i przetwarzane asynchronicznie, a wynik jest wypychany na Twój endpoint, a nie pobierany na żądanie. Pytaj wprost o mechanizm ponawiania prób i idempotencję, ponieważ webhook, który wysyła dane raz i się poddaje, potrafi po cichu zgubić dokumenty.

Na pierwszym miejscu pod względem wolumenu są działy zobowiązań, które przetwarzają faktury, paragony i zamówienia. Na kolejnym są finanse — wyciągi bankowe i raporty transakcji. Następnie logistyka przetwarzająca listy przewozowe i dowody dostawy, aż po każdy proces, w którym dokument pojawia się jako załącznik do e-maila i musi trafić do konkretnego systemu.

Niektóre mogą i warto oddzielać to od standardowych deklaracji bycia zgodnym z RODO. Parseur jest hostowany w UE: dane są przetwarzane i przechowywane w Unii Europejskiej, a samo centrum danych posiada certyfikat ISO 27001. Pytaj innych dostawców o takie gwarancje na piśmie — obejmujące obszary przetwarzania, cache, kopie zapasowe i logi, ponieważ baza danych w UE obsługiwana przez amerykański endpoint przetwarzający to nie jest rezydencja danych w UE.

Schemat JSON to fundament komunikacji między API ekstrakcyjnym a wszystkimi procesami działającymi na niższych warstwach systemu. To on odpowiada za weryfikację typów danych, potrafi wychwycić datę przesłaną w formie tekstu oraz powstrzymuje uszkodzony pakiet danych przed wniknięciem do Twojego systemu ERP. Skonfiguruj niezbędny schemat jeszcze przed rozmową z dostawcami, a potem sprawdź, czy każde dostarczane przez nich API jest w stanie oddać Ci precyzyjnie te wartości.