Editing
Jak si postavit vlastní RAG a nespálit se
Jump to navigation
Jump to search
Warning:
You are not logged in. Your IP address will be publicly visible if you make any edits. If you
log in
or
create an account
, your edits will be attributed to your username, along with other benefits.
Anti-spam check. Do
not
fill this in!
<br>Dalším častým oříškem je zpracování dotazu uživatele. Než dotaz pošlete do vyhledávání, upravte ho. Rozdělte složené otázky na jednotlivé části, přeformulujte negace a vyjasněte si, co uživatel skutečně potřebuje. V praxi se vyplatí použít malý model, který dotaz převede na několik variant, a každou z nich poslat do vyhledávání. Výsledky pak sloučíte a až poté předáte hlavnímu modelu. Tím se výrazně zvýší šance, že najdete relevantní pasáž.<br><br>Retrieval není jen o vektorové podobnosti Jakmile máte index, přichází fáze ladění. Vezměte si deset reálných dotazů a ručně si označte, které části dokumentů jsou [https://wiki.mngl.net/index.php?title=Jak_zautomatyzovat_fakturaci_a_u%C5%A1et%C5%99it_%C4%8Das_i_starosti rady pro rekonstrukci] odpověď klíčové. Pak porovnejte, jestli vám retrieval vrátí ty správné. Pokud ne, zvyšte počet vrácených dokumentů, experimentujte s metrikou podobnosti a zkuste hybridní přístup — kombinaci vektorů a klíčových slov. Tím se zbavíte situací, kdy model odpovídá obecně, [https://search.yahoo.com/search?p=proto%C5%BEe%20nena%C5%A1el protože nenašel] konkrétní číslo nebo jméno.<br><br>Velkým oříškem bývá metadata. Přemýšlejte o tom, co je pro váš doménový dotaz důležité: datum, autor, kategorie, typ dokumentu. Tato pole pak využijte jako filtr před samotným retrievalem. Pokud máte směs starých a nových dokumentů, bez filtru vám model může odpovědět podle zastaralé verze. U dlouhých dokumentů se vyplatí indexovat po částech (např. kapitolách) a ukládat si odkaz na rodičovský celek, abyste mohli v promptu poskytnout i kontext celé sekce.<br><br>Než si otevřete první nástroj s umělou inteligencí, zastavte se. Většina začátečníků udělá stejnou chybu: napíše první otázku, která je napadne, a pak se diví, že odpověď je obecná nebo nepoužitelná. AI není kouzelná koule, ale nástroj, který funguje podle toho, jak s ním zacházíte. Čím konkrétnější a strukturovanější zadání, tím užitečnější výsledek. Přemýšlejte o tom jako o zadání úkolu podřízenému – musíte mu říct, co přesně chcete, v jakém rozsahu a v jaké podobě.<br><br>Nezapomeňte na takzvaný „český háček": právní termíny a formulace jsou v češtině hodně specifické a AI může mít problém s rozpoznáním důležitých pasáží, jako jsou rozhodčí doložky nebo smluvní pokuty. Pořiďte si proto do implementačního týmu někoho, kdo rozumí právu a zároveň se nebojí technologií – ideálně právníka s IT citem. Ten nastaví pravidla pro klasifikaci dokumentů a vytvoří šablony, podle kterých se AI naučí, co je důležité. Bez této role skončíte s nástrojem, který vám sice najde každý výskyt slova „smlouva", ale nebude umět rozlišit přílohu od hlavního dokumentu.<br><br>Největší chybou začátečníků je rozdělování dokumentů na pevné úseky podle znaků nebo tokenů. Text pak uprostřed věty přerušíte a ztratíte souvislost. Místo toho rozdělujte podle logických celků — odstavců, sekcí, nadpisů. Ideální velikost chunků se pohybuje mezi 300 a 800 tokeny, ale neexistuje univerzální číslo. Vyzkoušejte různé velikosti a vyhodnocujte kvalitu odpovědí na testovací sadě otázek. Důležité je také přidat do každého chunku metadata — zdroj, datum, typ dokumentu. To vám umožní později filtrovat výsledky a zobrazit uživateli, odkud odpověď pochází.<br><br>Na závěr nezapomeňte, že RAG je živý systém. Datové zdroje se mění, dokumenty přibývají a staré se ruší. Zaveďte si pravidelné přeindexování a sledujte, kdy se kvalita odpově[https://www.Medcheck-Up.com/?s=d%C3%AD%20za%C4%8Dne dí začne] zhoršovat. Mějte v kódu oddělenou konfiguraci pro chunking a retrieval, [https://manual.emk-schweiz.ch/index.php?title=Jak_automatizovat_podporu_z%C3%A1kazn%C3%ADk%C5%AFm,_ani%C5%BE_by_utrp%C4%9Bla_kvalita Proměna bytu] abyste mohli experimentovat bez zásahu do produkce. A hlavně: neustále testujte na reálných dotazech, ne na uměle vytvořených vzorcích. Jen tak zjistíte, co skutečně potřebujete vyladit.<br><br>Začněte s jednoduchými úkoly, které vám ušetří čas. Typicky jde o přepis textu, shrnutí návodu, brainstorming nápadů nebo přípravu e-mailu. Vyhněte se ale tomu, abyste AI používali na věci, kterým sami nerozumíte. Pokud se nevyznáte v účetnictví a necháte si od ní napsat daňové přiznání, riskujete, že chybu neodhalíte. AI se umí velmi sebevědomě mýlit. Její výstup je proto vždy nutné brát jako návrh, ne jako hotovou pravdu.<br><br>Na závěr si připravte evaluační sadu a nepodceňujte ji. Vytvořte si alespoň padesát otázek, na které znáte správné odpovědi z dokumentů. Pak si proces vyhodnocení zautomatizujte — připravte skript, který pro každou otázku spustí celý řetězec a zkontroluje, jestli odpověď obsahuje klíčové informace. Nevyhodnocujte jen to, jestli se odpověď shoduje s referenční, ale i to, jestli systém našel správné zdroje. Bez automatizované evaluace totiž nikdy nezjistíte, že změna parametru chunkingu zhoršila kvalitu o třicet procent, protože si to nebudete pamatovat.<br><br>Základní rozdíl mezi nástroji spočívá v úrovni zpracování jazyka. Jednoduché vyhledávače fungují na bázi klíčových slov – rychle najdou, kde se v textu vyskytuje slovo „sankce" nebo „odpovědnost", ale nerozumí kontextu. Pokročilé systémy s porozuměním přirozenému jazyku rozpoznají, kdo je odpovědný, za jakých podmínek a jaká práva z toho plynou. Pro analýzu rizik proto vždy preferujte nástroj, který umí extrahovat entity (strany, částky, data) a vztahy mezi nimi. Typická chyba je vybrat nástroj podle počtu funkcí, ne podle toho, jak přesně rozpoznává specifickou strukturu vašich smluv – u standardizovaných dokumentů uspěje i jednodušší řešení, u atypických textů selže.<br><br>If you liked this post and you would like to obtain more facts pertaining to [http://Racist.wiki/index.php/Jak_zvl%C3%A1dnout_spr%C3%A1vu_pr%C3%A1v,_ne%C5%BE_firma_p%C5%99eroste_chaos Rekonstrukce Bytu] kindly check out our web page.<br>
Summary:
Please note that all contributions to IT-Core are considered to be released under the GNU Free Documentation License 1.3 or later (see
IT-Core:Copyrights
for details). If you do not want your writing to be edited mercilessly and redistributed at will, then do not submit it here.
You are also promising us that you wrote this yourself, or copied it from a public domain or similar free resource.
Do not submit copyrighted work without permission!
Cancel
Editing help
(opens in new window)
Navigation menu
Personal tools
Not logged in
Talk
Contributions
Create account
Log in
Namespaces
Page
Discussion
English
Views
Read
Edit
View history
More
Search
Navigation
Main page
Recent changes
Random page
Help about MediaWiki
Special pages
Tools
What links here
Related changes
Page information