Aktuality

DocuWare IDP GenAI Extraction: inteligentní vytěžování dokumentů s okamžitými výsledky

Vytěžování dat pomocí generativní AI, které je součástí inteligentního zpracování dokumentů v řešení DocuWare IDP, mění způsob, jakým firmy pracují s dokumenty. V tomto článku si ukážeme, jak GenAI Extraction funguje, provedeme vás krok za krokem jeho nastavením a přidáme tipy, jak z něj získat co nejlepší výsledky.

DIGITALIZACE POD LUPOU

DocuWare IDP GenAI Extraction: inteligentní vytěžování dokumentů s okamžitými výsledky

Vytěžování dat pomocí generativní AI, které je součástí inteligentního zpracování dokumentů v řešení DocuWare IDP, mění způsob, jakým firmy pracují s dokumenty. V tomto článku si ukážeme, jak GenAI Extraction funguje, provedeme vás krok za krokem jeho nastavením a přidáme tipy, jak z něj získat co nejlepší výsledky.

Co je GenAI Extraction?

GenAI Extraction je funkce v řešení DocuWare IDP, která využívá generativní umělou inteligenci k automatickému vytěžování strukturovaných dat z nestrukturovaných dokumentů, jako jsou faktury, smlouvy nebo dodací listy.

Na rozdíl od tradičních systémů pro zpracování dokumentů, které vyžadují předem připravené šablony a ruční mapování dat, využívá GenAI Extraction umělou inteligenci a zpracování přirozeného jazyka. Díky tomu je nastavení rychlejší, jednodušší a mnohem flexibilnější. Uživatel pouze definuje požadovaná datová pole pomocí přirozeného jazyka a o zbytek se postará umělá inteligence. Není potřeba vytvářet šablony ani provádět složitou konfiguraci systému.

Co je Zero-Shot Extraction a jak funguje?

Zero-Shot Extraction je klíčová funkce technologie GenAI Extraction, která umožňuje vytěžovat data z dokumentů bez předchozího trénování modelu nebo ručního označování dat. Díky tomu lze dosáhnout kvalitních výchozích výsledků ihned po nasazení, aniž by bylo nutné systém předem učit na konkrétních typech dokumentů.

Jak Zero-Shot Extraction funguje?

Zero-Shot Extraction probíhá přímo při zpracování dokumentů – nikoli během vytváření nebo trénování AI modelu. Model generativní AI je již předem natrénován na široké škále různých typů dokumentů.

Jakmile nahrajete dokument a běžným jazykem popíšete, jaká data chcete vytěžit, GenAI okamžitě využije své znalosti k rozpoznání a extrakci požadovaných informací. Dokáže přitom pracovat i s typy dokumentů nebo rozvržením, se kterými se dříve nesetkal.

Není potřeba vytvářet vlastní AI modely, provádět ruční anotaci dat ani připravovat šablony. Stačí definovat požadovaná datová pole a GenAI během několika okamžiků poskytne první výsledky.

Čím je GenAI Extraction jedinečný?

GenAI Extraction nevyžaduje před zahájením práce žádné trénování modelu, ruční označování dat ani vytváření šablon. Stačí nahrát dokument, definovat požadovaná datová pole a během okamžiku získáte první výsledky vytěžování.

GenAI interpretuje definice datových polí a analyzuje dokument jako celek. Díky tomu dokáže přesně vytěžovat data i z dokumentů s odlišným rozvržením nebo strukturou.

GenAI Extraction umožňuje rychlé nasazení a flexibilní vytěžování dat bez vytváření šablon, ruční anotace nebo předchozího trénování AI modelu. Technologie Zero-Shot Extraction zajišťuje, že první výsledky získáte ihned po definování datových polí.

Kdo GenAI Extraction nastavuje – administrátor nebo uživatel?

Jednou z hlavních výhod GenAI Extraction je jeho flexibilita a snadné používání. Datová pole může podle přidělených oprávnění definovat nebo upravovat jak administrátor, tak i koncový uživatel.

Administrátoři obvykle vytvářejí standardizované sady polí, které zajišťují jednotné zpracování dokumentů v celé organizaci. Koncoví uživatelé si naopak mohou přímo v uživatelském rozhraní vytvářet nebo upravovat datová pole podle svých aktuálních potřeb.

To vše bez nutnosti pokročilých technických znalostí nebo zkušeností s vývojem a trénováním modelů umělé inteligence.

Jak GenAI Extraction funguje krok za krokem

GenAI Extraction nabízí jednoduchý a efektivní postup pro automatické vytěžování dat z dokumentů:

1. Nahrání dokumentů

Do procesu vytěžování se nahrají dokumenty, například faktury, smlouvy nebo dodací listy.

Dokumenty lze zpracovat dvěma způsoby:

  • výběrem již uložených dokumentů z prostředí DocuWare, kde se pro trénování využívají jejich indexová data.
  • nahráním dokumentů společně s odpovídajícími daty ve formátu JSON, která slouží pro trénování modelu, nebo

2. Definice datových polí (schématu)

Uživatelé definují datová pole, která chtějí z dokumentů vytěžovat. U každého pole zadají jeho název a stručný popis v přirozeném jazyce. Soubor těchto polí tvoří cílové schéma, podle kterého GenAI rozpozná a vytvoří strukturovaný výstup.

V závislosti na přidělených oprávněních a potřebách organizace mohou datová pole vytvářet a spravovat administrátoři i běžní uživatelé. Díky tomu lze požadavky na vytěžování dat snadno přizpůsobovat bez vytváření šablon, ruční anotace dokumentů nebo složité konfigurace.

Například při nastavení vytěžování dat z faktur můžete definovat tato pole:

  • Název dodavatele – název společnosti, která fakturu vystavila, obvykle umístěný v horní části dokumentu nebo v záhlaví.
  • Číslo faktury – jedinečný identifikátor faktury, často označený jako „Číslo faktury“ nebo „Invoice No.“.
  • Datum vystavení – datum, kdy byla faktura vystavena, zpravidla uvedené v horní části dokumentu.
  • Celková částka – celková částka k úhradě, obvykle označená jako „Celkem“ nebo „K úhradě“ a umístěná ve spodní části dokumentu.
  • Datum splatnosti – datum, do kterého má být faktura uhrazena.

Kvalitně definovaná datová pole zvyšují přesnost vytěžování i u dokumentů s různým rozvržením nebo formátem.

Po nahrání dokumentu a definování datových polí probíhá vytěžování dat zcela automaticky. Uživatel pouze spustí proces a GenAI okamžitě využije své předem natrénované znalosti spolu s definicemi jednotlivých polí k rozpoznání a vytěžení požadovaných informací.

Není potřeba vytvářet šablony, ručně označovat data ani předem trénovat AI model. První výsledky jsou k dispozici okamžitě. Uživatel je pouze zkontroluje, případně upraví definice datových polí a proces zopakuje.

Po dokončení vytěžování následuje kontrola a validace výsledků.

Pokud některé datové pole nevrací očekávané hodnoty, lze jednoduše upravit jeho popis nebo doplnit příklady požadovaných hodnot. Pro náročnější scénáře je k dispozici také možnost dodatečného trénování AI modelu, ve většině případů však není potřeba.

Administrátoři obvykle spravují šablony a schémata vytěžování, aby bylo zajištěno jednotné zpracování dokumentů v celé organizaci. Pokud to oprávnění dovolují, mohou si však vlastní schémata vytvářet nebo upravovat také koncoví uživatelé podle svých konkrétních potřeb.

Jakmile je pro určitý typ dokumentu vytvořeno schéma, GenAI jej automaticky použije i při zpracování dalších dokumentů stejného typu. Není tedy nutné provádět stejné nastavení opakovaně, což výrazně urychluje práci a zjednodušuje správu celého procesu.

Kde celý proces probíhá?

Veškeré kroky probíhají přímo v prostředí pro správu dokumentů nebo ve rozhraní pro vytěžování dat. Uživatelé nemusí nastavovat pravidla pro vytěžování ani ručně označovat oblasti dokumentů (OCR zóny), jak je tomu u tradičních systémů. Celý proces je založen na inteligentním modelovém přístupu, kde se nastavení, samotné vytěžování i jeho průběžné zpřesňování řídí definicemi datových polí a ověřováním výsledků.

GenAI Extraction umožňuje rychlou automatizaci zpracování dokumentů. Díky přehlednému rozhraní se můžete soustředit na práci s daty místo nastavování systému.

Tipy pro dosažení nejlepších výsledků

  • Pro dosažení co nejpřesnějších výsledků vytvářejte jasné a podrobné definice datových polí. Uveďte očekávaný formát hodnot, přidejte příklady a co nejpřesněji popište, jaké informace má GenAI z dokumentu vytěžit.
  • Pokud výsledky nejsou dostatečně přesné, upravte definice datových polí nebo doplňte příklady a dokument zpracujte znovu.
  • Přesnost vytěžování můžete průběžně zvyšovat validací výsledků. Potvrzováním správných hodnot a opravou nepřesností pomáháte systému lépe porozumět vašim požadavkům.
  • Validace probíhá přímo v uživatelském rozhraní nebo na přehledovém panelu, kde uživatelé kontrolují výsledky vytěžování a podle potřeby je schvalují nebo opravují pro každý zpracovaný dokument.

Autorka článku:

Tracey Carrillo

Product Marketing Manager, DocuWare

Zjistěte, jestli můžeme pomoci i vám!

Notebook

Webinář zdarma

Prezentace nejdůležitějších vlastností našeho řešení a ukázka rozhraní.

Komunikace

Prezentace na míru

Nechte si ukázat, jak můžeme zefektivnit chod právě vaší firmy.

Podkres