{"id":20217,"date":"2026-08-14T12:03:36","date_gmt":"2026-08-14T12:03:36","guid":{"rendered":"https:\/\/greyson.eu\/?post_type=glossary&#038;p=20217"},"modified":"2026-08-14T12:14:33","modified_gmt":"2026-08-14T12:14:33","slug":"data-lake","status":"publish","type":"glossary","link":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/","title":{"rendered":"Data Lake"},"content":{"rendered":"<div id=\"model-response-message-contentr_01a15b85f79dc1db\" class=\"markdown markdown-main-panel md-content enable-luminous-fast-follows enable-updated-hr-color stronger\" dir=\"ltr\" aria-busy=\"false\" aria-live=\"polite\">\n<h2 data-path-to-node=\"2\">Co je to Data Lake? Kompletn\u00ed pr\u016fvodce pro l\u00eddry v oblasti IT v podnic\u00edch<\/h2>\n<div>V \u00e9\u0159e digit\u00e1ln\u00ed transformace se organizace top\u00ed v datech. Ka\u017ed\u00e1 transakce, ode\u010det ze sn\u00edma\u010de, interakce se z\u00e1kazn\u00edkem a provozn\u00ed ud\u00e1lost generuj\u00ed informace, kter\u00e9 by mohly odemknout konkuren\u010dn\u00ed v\u00fdhodu \u2013 pokud byste k nim m\u011bli p\u0159\u00edstup, rozum\u011bli jim a dok\u00e1zali na n\u011b rychle reagovat. Zde se data lake st\u00e1v\u00e1 nezbytnost\u00ed. <b data-path-to-node=\"3\" data-index-in-node=\"318\">Data lake<\/b> je centralizovan\u00e9 \u00falo\u017ei\u0161t\u011b, kter\u00e9 uchov\u00e1v\u00e1 velk\u00e9 objemy strukturovan\u00fdch, polostrukturovan\u00fdch a nestrukturovan\u00fdch dat v jejich rodn\u00e9m, syrov\u00e9m form\u00e1tu, co\u017e organizac\u00edm umo\u017e\u0148uje prov\u00e1d\u011bt analytiku, strojov\u00e9 u\u010den\u00ed a pokro\u010dilou analytiku ve velk\u00e9m m\u011b\u0159\u00edtku. Na rozd\u00edl od tradi\u010dn\u00edch datov\u00fdch sklad\u016f, kter\u00e9 vynucuj\u00ed p\u0159\u00edsn\u00e1 sch\u00e9mata je\u0161t\u011b p\u0159ed ulo\u017een\u00edm dat, se data lakes vyzna\u010duj\u00ed flexibilitou, kter\u00e1 v\u00e1m umo\u017en\u00ed ulo\u017eit cokoli a pt\u00e1t se pozd\u011bji. Pro l\u00eddry v oblasti IT a CTO, kte\u0159\u00ed se pohybuj\u00ed v prost\u0159ed\u00ed digit\u00e1ln\u00ed transformace, u\u017e nen\u00ed pochopen\u00ed data lakes voliteln\u00e9 \u2013 je to z\u00e1klad modern\u00ed podnikov\u00e9 strategie.<\/div>\n<h2 data-path-to-node=\"5\">Co p\u0159esn\u011b je Data Lake?<\/h2>\n<h3 data-path-to-node=\"6\">Z\u00e1kladn\u00ed definice a koncept<\/h3>\n<div>Data lake se z\u00e1sadn\u011b li\u0161\u00ed od \u0159e\u0161en\u00ed pro ukl\u00e1d\u00e1n\u00ed dat, kter\u00e1 mu p\u0159edch\u00e1zela. Ve sv\u00e9 podstat\u011b je data lake velkokapacitn\u00ed centralizovan\u00e9 \u00falo\u017ei\u0161t\u011b navr\u017een\u00e9 k p\u0159ij\u00edm\u00e1n\u00ed a ukl\u00e1d\u00e1n\u00ed dat v jejich p\u016fvodn\u00ed, nezpracovan\u00e9 podob\u011b. Term\u00edn \u201esyrov\u00fd form\u00e1t\u201c (raw format) je zde kl\u00ed\u010dov\u00fd: data p\u0159ich\u00e1zej\u00ed do data lake bez transformace, \u010di\u0161t\u011bn\u00ed nebo vynucen\u00ed sch\u00e9matu. M\u016f\u017ee j\u00edt o soubory JSON z API, exporty CSV z legacy syst\u00e9m\u016f, bin\u00e1rn\u00ed logy ze sn\u00edma\u010d\u016f IoT, obr\u00e1zky, videa nebo strukturovan\u00e9 datab\u00e1zov\u00e9 tabulky \u2013 v\u0161e existuje vedle sebe v stejn\u00e9m \u00falo\u017ei\u0161ti.<\/div>\n<div>Architektura, kter\u00e1 to umo\u017e\u0148uje, se z\u00e1sadn\u011b li\u0161\u00ed od tradi\u010dn\u00edch hierarchick\u00fdch \u00falo\u017en\u00fdch syst\u00e9m\u016f. Zat\u00edmco datov\u00e9 sklady organizuj\u00ed data v strukturovan\u00e9m, hierarchick\u00e9m souborov\u00e9m syst\u00e9mu (slo\u017eky ve slo\u017ek\u00e1ch), data lakes vyu\u017e\u00edvaj\u00ed <b data-path-to-node=\"8\" data-index-in-node=\"228\">plochou architekturu s objektov\u00fdm \u00falo\u017ei\u0161t\u011bm<\/b>. Objektov\u00e9 \u00falo\u017ei\u0161t\u011b p\u0159istupuje ke ka\u017ed\u00e9mu kusu dat jako k objektu s p\u0159idru\u017een\u00fdmi metadaty a unik\u00e1tn\u00edm identifik\u00e1torem. Tato ploch\u00e1 struktura odstra\u0148uje \u00fazk\u00e1 hrdla v\u00fdkonu spojen\u00e1 s hierarchickou navigac\u00ed a umo\u017e\u0148uje masivn\u00ed \u0161k\u00e1lovatelnost. M\u016f\u017eete ukl\u00e1dat petabajty dat, ani\u017e byste se museli starat o hloubku adres\u00e1\u0159\u016f nebo omezen\u00ed souborov\u00e9ho syst\u00e9mu.<\/div>\n<div>Syst\u00e9m ozna\u010dov\u00e1n\u00ed metadaty v objektov\u00e9m \u00falo\u017ei\u0161ti je dal\u0161\u00ed kritickou v\u00fdhodou. Ka\u017ed\u00fd objekt m\u016f\u017ee b\u00fdt ozna\u010den popisn\u00fdmi metadaty \u2013 datum vytvo\u0159en\u00ed, zdrojov\u00fd syst\u00e9m, typ dat, vlastn\u00edk, \u00farove\u0148 klasifikace \u2013, co\u017e usnad\u0148uje vyhled\u00e1v\u00e1n\u00ed, na\u010d\u00edt\u00e1n\u00ed a spr\u00e1vu dat nap\u0159\u00ed\u010d regiony a \u010dasem. Tato vrstva metadat se st\u00e1v\u00e1 z\u00e1kladem pro objevov\u00e1n\u00ed dat a governance v modern\u00edm data lake.<\/div>\n<table data-path-to-node=\"10\">\n<thead>\n<tr>\n<td><strong>Charakteristika<\/strong><\/td>\n<td><strong>Data Lake<\/strong><\/td>\n<td><strong>Data Warehouse<\/strong><\/td>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><span data-path-to-node=\"10,1,0,0\"><b data-path-to-node=\"10,1,0,0\" data-index-in-node=\"0\">Form\u00e1t dat<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,1,1,0\">Syrov\u00fd, rodn\u00fd form\u00e1t (JSON, CSV, obr\u00e1zky, logy atd.)<\/span><\/td>\n<td><span data-path-to-node=\"10,1,2,0\">Strukturovan\u00e1, vy\u010di\u0161t\u011bn\u00e1, transformovan\u00e1 data<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,2,0,0\"><b data-path-to-node=\"10,2,0,0\" data-index-in-node=\"0\">P\u0159\u00edstup ke sch\u00e9matu<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,2,1,0\">Schema-on-read (definov\u00e1n\u00ed struktury p\u0159i anal\u00fdze)<\/span><\/td>\n<td><span data-path-to-node=\"10,2,2,0\">Schema-on-write (definov\u00e1n\u00ed struktury p\u0159ed ulo\u017een\u00edm)<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,3,0,0\"><b data-path-to-node=\"10,3,0,0\" data-index-in-node=\"0\">Architektura \u00falo\u017ei\u0161t\u011b<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,3,1,0\">Ploch\u00e1 architektura s objektov\u00fdm \u00falo\u017ei\u0161t\u011bm<\/span><\/td>\n<td><span data-path-to-node=\"10,3,2,0\">Hierarchick\u00fd souborov\u00fd syst\u00e9m nebo relacn\u00ed tabulky<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,4,0,0\"><b data-path-to-node=\"10,4,0,0\" data-index-in-node=\"0\">\u0160k\u00e1lovatelnost<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,4,1,0\">Vysoce \u0161k\u00e1lovateln\u00e9, levn\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b<\/span><\/td>\n<td><span data-path-to-node=\"10,4,2,0\">\u0160k\u00e1lovateln\u00e9, ale s vy\u0161\u0161\u00edmi n\u00e1klady na jednotku<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,5,0,0\"><b data-path-to-node=\"10,5,0,0\" data-index-in-node=\"0\">Podporovan\u00e9 typy dat<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,5,1,0\">V\u0161echny typy: strukturovan\u00e1, polostrukturovan\u00e1, nestrukturovan\u00e1<\/span><\/td>\n<td><span data-path-to-node=\"10,5,2,0\">P\u0159edev\u0161\u00edm strukturovan\u00e1 data<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,6,0,0\"><b data-path-to-node=\"10,6,0,0\" data-index-in-node=\"0\">V\u00fdkon dotaz\u016f<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,6,1,0\">Prom\u011bnliv\u00fd; optimalizovan\u00fd pro objevov\u00e1n\u00ed a ML<\/span><\/td>\n<td><span data-path-to-node=\"10,6,2,0\">Optimalizovan\u00fd pro rychl\u00e9 dotazy BI a reportingu<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,7,0,0\"><b data-path-to-node=\"10,7,0,0\" data-index-in-node=\"0\">\u010cas na z\u00edsk\u00e1n\u00ed poznatk\u016f (Time to Insight)<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,7,1,0\">Pomal\u011bj\u0161\u00ed po\u010d\u00e1te\u010dn\u00ed dotazy; rychlej\u0161\u00ed pr\u016fzkumn\u00e1 anal\u00fdza<\/span><\/td>\n<td><span data-path-to-node=\"10,7,2,0\">Rychl\u00e9 p\u0159eddefinovan\u00e9 reporty; pomalej\u0161\u00ed ad-hoc anal\u00fdza<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"10,8,0,0\"><b data-path-to-node=\"10,8,0,0\" data-index-in-node=\"0\">Hlavn\u00ed p\u0159\u00edpad pou\u017eit\u00ed (Use Case)<\/b><\/span><\/td>\n<td><span data-path-to-node=\"10,8,1,0\">Pr\u016fzkum dat, ML, big data analytika<\/span><\/td>\n<td><span data-path-to-node=\"10,8,2,0\">Business intelligence, reporting, OLAP<\/span><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3 data-path-to-node=\"12\">Historick\u00fd v\u00fdvoj: Od datov\u00fdch sklad\u016f k Data Lakes<\/h3>\n<div>Abyste pochopili, pro\u010d se data lakes objevily, pom\u016f\u017ee pochopit omezen\u00ed syst\u00e9m\u016f, z nich\u017e se vyvinuly. Datov\u00e9 sklady, kter\u00e9 v 90. letech 20. stolet\u00ed pr\u016fkopnicky zavedli lid\u00e9 jako Ralph Kimball a Bill Inmon, byly revolu\u010dn\u00ed. Centralizovaly data z r\u016fzn\u00fdch provozn\u00edch syst\u00e9m\u016f, aplikovaly p\u0159\u00edsn\u00e9 procesy ETL (Extract, Transform, Load) a organizovaly data do dimenzion\u00e1ln\u00edch model\u016f optimalizovan\u00fdch pro business intelligence a reporting. Po cel\u00e9 dek\u00e1dy to byl zlat\u00fd standard pro podnikovou analytiku.<\/div>\n<div>Do po\u010d\u00e1tku roku 2010 se v\u0161ak za\u010dala projevovat jejich omezen\u00ed. Exploze velk\u00fdch dat (big data) \u2013 hnan\u00e1 internetem, mobiln\u00edmi za\u0159\u00edzen\u00edmi, sn\u00edma\u010di IoT a soci\u00e1ln\u00edmi m\u00e9dii \u2013 generovala data v objemech, rozmanitosti a rychlostech, kter\u00e9 tradi\u010dn\u00ed datov\u00e9 sklady zvl\u00e1daly jen st\u011b\u017e\u00ed. P\u0159\u00edstup schema-on-write znamenal, \u017ee p\u0159ed ulo\u017een\u00edm jak\u00fdchkoli nov\u00fdch dat musely IT t\u00fdmy definovat jejich strukturu. To vytv\u00e1\u0159elo \u00fazk\u00e1 hrdla. Datov\u00fd v\u011bdec, kter\u00fd cht\u011bl experimentovat s nov\u00fdm zdrojem dat, musel \u010dekat t\u00fddny, ne\u017e IT navrhne a implementuje nov\u00e9 sch\u00e9ma. N\u00e1klady na ukl\u00e1d\u00e1n\u00ed v datov\u00fdch skladech byly tak\u00e9 ne\u00fam\u011brn\u011b vysok\u00e9 pro ukl\u00e1d\u00e1n\u00ed syrov\u00fdch, pr\u016fzkumn\u00fdch dat.<\/div>\n<div>Pojem \u201edata lake\u201c vznikl kolem let 2010\u20132011 a do pop\u0159ed\u00ed se dostal s t\u00edm, jak organizace p\u0159ij\u00edmaly Hadoop a cloudov\u00e1 objektov\u00e1 \u00falo\u017ei\u0161t\u011b (jako Amazon S3). Koncept byl l\u00e1kav\u00fd: ulo\u017ete v\u0161e v syrov\u00e9 podob\u011b, za n\u00edzk\u00e9 n\u00e1klady, a nechte u\u017eivatele, aby data objevovali a analyzovali podle pot\u0159eby. Tento posun p\u0159edstavoval z\u00e1sadn\u00ed zm\u011bnu filozofie \u2013 od \u201enejprve strukturovat, pak analyzovat\u201c k \u201enejprve ulo\u017eit, strukturovat podle pot\u0159eby\u201c. V letech 2015\u20132018 se data lakes staly v podnikatelsk\u00fdch organizac\u00edch b\u011b\u017en\u00fdm standardem a v\u011bt\u0161ina spole\u010dnost\u00ed z \u017eeb\u0159\u00ed\u010dku Fortune 500 implementovala n\u011bjakou formu architektury data lake.<\/div>\n<h3 data-path-to-node=\"17\">Role objektov\u00e9ho \u00falo\u017ei\u0161t\u011b v Data Lakes<\/h3>\n<div>Objektov\u00e9 \u00falo\u017ei\u0161t\u011b je technologick\u00fdm z\u00e1kladem, kter\u00fd modern\u00ed data lakes umo\u017e\u0148uje. Na rozd\u00edl od tradi\u010dn\u00edho blokov\u00e9ho \u00falo\u017ei\u0161t\u011b (pou\u017e\u00edvan\u00e9ho v datab\u00e1z\u00edch a souborov\u00fdch syst\u00e9mech) nebo souborov\u00e9ho \u00falo\u017ei\u0161t\u011b (pou\u017e\u00edvan\u00e9ho v syst\u00e9mech NAS) p\u0159istupuje objektov\u00e9 \u00falo\u017ei\u0161t\u011b k dat\u016fm jako k samostatn\u00fdm objekt\u016fm. Ka\u017ed\u00fd objekt obsahuje samotn\u00e1 data, metadata o objektu a unik\u00e1tn\u00ed identifik\u00e1tor (typicky kl\u00ed\u010d nebo cestu).<\/div>\n<div>Tento n\u00e1vrh m\u00e1 dalekos\u00e1hl\u00e9 d\u016fsledky. Syst\u00e9my blokov\u00e9ho a souborov\u00e9ho \u00falo\u017ei\u0161t\u011b organizuj\u00ed data hierarchicky \u2013 proch\u00e1z\u00edte adres\u00e1\u0159i a slo\u017ekami, abyste na\u0161li soubor. To funguje dob\u0159e pro mal\u00e9 a\u017e st\u0159edn\u011b velk\u00e9 datov\u00e9 sady, ale p\u0159i velk\u00e9m m\u011b\u0159\u00edtku se to st\u00e1v\u00e1 \u00fazk\u00fdm hrdlem v\u00fdkonu. Objektov\u00e9 \u00falo\u017ei\u0161t\u011b tuto hierarchii odstra\u0148uje. A\u0165 u\u017e ukl\u00e1d\u00e1te 100 gigabajt\u016f nebo 100 petabajt\u016f, doba na\u010d\u00edt\u00e1n\u00ed z\u016fst\u00e1v\u00e1 konzistentn\u00ed, proto\u017ee syst\u00e9m pou\u017e\u00edv\u00e1 distribuovan\u00e9 indexov\u00e1n\u00ed a ozna\u010dov\u00e1n\u00ed metadaty nam\u00edsto proch\u00e1zen\u00ed adres\u00e1\u0159\u016f.<\/div>\n<div>Mo\u017enost ozna\u010dov\u00e1n\u00ed metadaty je stejn\u011b d\u016fle\u017eit\u00e1. V objektov\u00e9m \u00falo\u017ei\u0161ti m\u016f\u017eete ke ka\u017ed\u00e9mu objektu p\u0159ipojit neomezen\u00e9 mno\u017estv\u00ed dvojic kl\u00ed\u010d-hodnota, co\u017e umo\u017e\u0148uje bohatou klasifikaci a objevov\u00e1n\u00ed. Datovou sadu m\u016f\u017eete ozna\u010dit jej\u00edm zdrojov\u00fdm syst\u00e9mem, datem vytvo\u0159en\u00ed, vlastn\u00edkem, \u00farovn\u00ed klasifikace dat (ve\u0159ejn\u00e1\/d\u016fv\u011brn\u00e1) a obchodn\u00ed dom\u00e9nou. Pozd\u011bji m\u016f\u017eete dotazovat nap\u0159\u00ed\u010d v\u0161emi objekty se specifick\u00fdmi hodnotami tag\u016f, co\u017e umo\u017e\u0148uje pokro\u010dilou spr\u00e1vu a objevov\u00e1n\u00ed dat.<\/div>\n<div>Poskytovatel\u00e9 cloudov\u00fdch slu\u017eeb u\u010dinili objektov\u00e9 \u00falo\u017ei\u0161t\u011b neuv\u011b\u0159iteln\u011b cenov\u011b v\u00fdhodn\u00fdm. Nap\u0159\u00edklad Amazon S3 stoj\u00ed zlomek ceny tradi\u010dn\u00edch \u00falo\u017en\u00fdch \u0159e\u0161en\u00ed, p\u0159i\u010dem\u017e ceny se pohybuj\u00ed v rozmez\u00ed 0,023 USD za GB m\u011bs\u00ed\u010dn\u011b pro \u010dasto p\u0159istupovan\u00e1 data. Tato ekonomika z\u00e1sadn\u011b zm\u011bnila kalkul u ukl\u00e1d\u00e1n\u00ed dat \u2013 stalo se ekonomicky provediteln\u00fdm ukl\u00e1dat syrov\u00e1, pr\u016fzkumn\u00e1 data na dobu neur\u010ditou, m\u00edsto abyste je po anal\u00fdze smazali.<\/div>\n<h2 data-path-to-node=\"23\">Jak funguje architektura Data Lake?<\/h2>\n<h3 data-path-to-node=\"24\">Z\u00e1kladn\u00ed komponenty Data Lake<\/h3>\n<div>Produk\u010dn\u00ed data lake nen\u00ed pouh\u00fd \u00falo\u017en\u00fd prostor, kam se data jednodu\u0161e nasypou. Je to propracovan\u00fd syst\u00e9m s n\u011bkolika vrstvami, z nich\u017e ka\u017ed\u00e1 pln\u00ed specifickou funkci. Pochopen\u00ed t\u011bchto vrstev je pro l\u00eddry IT p\u0159i navrhov\u00e1n\u00ed nebo hodnocen\u00ed implementac\u00ed data lake z\u00e1sadn\u00ed.<\/div>\n<ul data-path-to-node=\"26\">\n<li>\n<div><b data-path-to-node=\"26,0,0\" data-index-in-node=\"0\">Ingest\u010dn\u00ed vrstva (Ingestion Layer)<\/b> je vstupn\u00edm bodem pro v\u0161echna data. Data p\u0159ich\u00e1zej\u00ed ze stovek nebo tis\u00edc\u016f zdroj\u016f: datab\u00e1z\u00ed, API, za\u0159\u00edzen\u00ed IoT, logovac\u00edch soubor\u016f, datov\u00fdch kan\u00e1l\u016f a u\u017eivatelsk\u00fdch nahr\u00e1n\u00ed. Ingest\u010dn\u00ed vrstva zvl\u00e1d\u00e1 tuto rozmanitost zdroj\u016f a form\u00e1t\u016f, \u010dasto za pou\u017eit\u00ed n\u00e1stroj\u016f jako Apache Kafka pro streamovan\u00e1 data nebo AWS Glue pro d\u00e1vkov\u00e9 ETL. Ingest\u010dn\u00ed vrstva mus\u00ed b\u00fdt flexibiln\u00ed (p\u0159ij\u00edmat jak\u00fdkoli form\u00e1t), spolehliv\u00e1 (zajistit, \u017ee nedojde ke ztr\u00e1t\u011b dat) a v\u00fdkonn\u00e1 (zvl\u00e1dat vysokokapacitn\u00ed datov\u00e9 toky).<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"26,1,0\" data-index-in-node=\"0\">\u00dalo\u017en\u00e1 vrstva (Storage Layer)<\/b> je m\u00edstem, kde s\u00eddl\u00ed syrov\u00e1 data. Typicky jde o cloudov\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b (S3, Azure Blob Storage, Google Cloud Storage) nebo distribuovan\u00e9 souborov\u00e9 syst\u00e9my jako HDFS v on-premise prost\u0159ed\u00edch. \u00dalo\u017en\u00e1 vrstva je organizov\u00e1na podle z\u00f3n syrov\u00fdch dat, \u010dasto navazuj\u00edc\u00edch na \u201ebronzovou\u201c z\u00f3nu, kam data p\u0159ich\u00e1zej\u00ed ve sv\u00e9 p\u016fvodn\u00ed podob\u011b, zcela netknut\u00e1.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"26,2,0\" data-index-in-node=\"0\">Zpracovatelsk\u00e1 vrstva (Processing Layer)<\/b> transformuje, obohacuje a \u010dist\u00ed data. N\u00e1stroje jako Apache Spark, Flink nebo Presto \u010dtou data z \u00falo\u017en\u00e9 vrstvy, aplikuj\u00ed obchodn\u00ed logiku a zapisuj\u00ed v\u00fdsledky do mezilehl\u00fdch nebo zpracovan\u00fdch datov\u00fdch z\u00f3n (v medailonov\u00e9 architektu\u0159e \u010dasto naz\u00fdvan\u00fdch \u201est\u0159\u00edbrn\u00e9\u201c z\u00f3ny). Zpracov\u00e1n\u00ed m\u016f\u017ee b\u00fdt orientovan\u00e9 na d\u00e1vky (b\u011b\u017e\u00edc\u00ed no\u010dn\u00ed \u00falohy) nebo streamovan\u00e9 (zpracov\u00e1n\u00ed dat v moment\u011b jejich p\u0159\u00edchodu).<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"26,3,0\" data-index-in-node=\"0\">Analytick\u00e1 a konzuma\u010dn\u00ed vrstva (Analytics and Consumption Layer)<\/b> je m\u00edstem, kde datov\u00ed v\u011bdci, analytici a aplikace p\u0159istupuj\u00ed k dat\u016fm za \u00fa\u010delem anal\u00fdzy, strojov\u00e9ho u\u010den\u00ed nebo reportingu. Tato vrstva m\u016f\u017ee zahrnovat SQL dotazovac\u00ed stroje (Presto, Spark SQL), frameworky pro strojov\u00e9 u\u010den\u00ed (TensorFlow, scikit-learn) nebo n\u00e1stroje business intelligence (Tableau, Power BI). Kl\u00ed\u010dov\u00e9 je, \u017ee stejn\u00e9 data lake m\u016f\u017ee sou\u010dasn\u011b obsluhovat v\u00edce vzorc\u016f konzumace \u2013 d\u00e1vkovou analytiku, \u0159\u00eddic\u00ed panely v re\u00e1ln\u00e9m \u010dase a tr\u00e9nov\u00e1n\u00ed model\u016f strojov\u00e9ho u\u010den\u00ed.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"26,4,0\" data-index-in-node=\"0\">Vrstva governance a metadat (Governance and Metadata Layer)<\/b> protnula v\u0161echny ostatn\u00ed vrstvy a zaji\u0161\u0165uje katalogizaci dat, sledov\u00e1n\u00ed p\u016fvodu (lineage), \u0159\u00edzen\u00ed p\u0159\u00edstupu a monitorov\u00e1n\u00ed kvality. N\u00e1stroje jako Apache Atlas, Collibra nebo cloudov\u011b nativn\u00ed \u0159e\u0161en\u00ed sleduj\u00ed, odkud data poch\u00e1zej\u00ed, jak byla transformov\u00e1na, kdo k nim m\u00e1 p\u0159\u00edstup a jak\u00e9 standardy kvality spl\u0148uj\u00ed.<\/div>\n<\/li>\n<\/ul>\n<h3 data-path-to-node=\"28\">Ingestace a pohyb dat<\/h3>\n<div>Ingestace dat je proces, p\u0159i kter\u00e9m syrov\u00e1 data vstupuj\u00ed do data lake. Existuj\u00ed dva hlavn\u00ed vzorce: <b data-path-to-node=\"29\" data-index-in-node=\"99\">d\u00e1vkov\u00e1 ingestace<\/b> a <b data-path-to-node=\"29\" data-index-in-node=\"119\">streamovan\u00e1 ingestace<\/b>.<\/div>\n<div>D\u00e1vkov\u00e1 ingestace zpracov\u00e1v\u00e1 data v odd\u011blen\u00fdch bloc\u00edch \u2013 typicky denn\u011b, t\u00fddn\u011b nebo na vy\u017e\u00e1d\u00e1n\u00ed. D\u00e1vkov\u00e1 \u00faloha m\u016f\u017ee ka\u017edou noc extrahovat data z legacy syst\u00e9mu ERP, transformovat je a nahr\u00e1t do data lake. D\u00e1vkov\u00fd p\u0159\u00edstup se dob\u0159e hod\u00ed pro zdroje, kter\u00e9 se aktualizuj\u00ed z\u0159\u00eddka nebo kde nen\u00ed kritick\u00e1 \u010derstvost v re\u00e1ln\u00e9m \u010dase. V\u00fdhodou je jednoduchost; d\u00e1vkov\u00e9 \u00falohy se sn\u00e1ze lad\u00ed a pl\u00e1nuj\u00ed. Nev\u00fdhodou je latence \u2013 data mohou b\u00fdt star\u00e1 hodiny nebo dny, ne\u017e se v data lake objev\u00ed.<\/div>\n<div>Streamovan\u00e1 ingestace zpracov\u00e1v\u00e1 data pr\u016fb\u011b\u017en\u011b, jak p\u0159ich\u00e1zej\u00ed. Tok ode\u010dt\u016f ze sn\u00edma\u010d\u016f IoT, ud\u00e1losti kliknut\u00ed z webu nebo data z finan\u010dn\u00edch trh\u016f proud\u00ed do data lake v re\u00e1ln\u00e9m \u010dase. Streamovan\u00e1 ingestace je nezbytn\u00e1 pro p\u0159\u00edpady pou\u017eit\u00ed vy\u017eaduj\u00edc\u00ed okam\u017eit\u00e9 poznatky \u2013 detekci podvod\u016f, doporu\u010den\u00ed v re\u00e1ln\u00e9m \u010dase nebo provozn\u00ed monitorov\u00e1n\u00ed. N\u00e1stroje jako Apache Kafka, AWS Kinesis nebo Azure Event Hubs umo\u017e\u0148uj\u00ed spolehliv\u00e9 streamovac\u00ed datov\u00e9 kan\u00e1ly s vysokou propustnost\u00ed.<\/div>\n<div>V\u011bt\u0161ina vysp\u011bl\u00fdch data lakes vyu\u017e\u00edv\u00e1 oba vzorce. Provozn\u00ed data (transakce, logy) p\u0159ich\u00e1zej\u00ed prost\u0159ednictv\u00edm streamov\u00e1n\u00ed pro analytiku v re\u00e1ln\u00e9m \u010dase, zat\u00edmco referen\u010dn\u00ed data (katalogy produkt\u016f, kmenov\u00e1 data z\u00e1kazn\u00edk\u016f) p\u0159ich\u00e1zej\u00ed denn\u011b v d\u00e1vk\u00e1ch. Ingest\u010dn\u00ed vrstva mus\u00ed efektivn\u011b zvl\u00e1dat oboj\u00ed.<\/div>\n<h3 data-path-to-node=\"34\">Vzorce pro ukl\u00e1d\u00e1n\u00ed a organizaci<\/h3>\n<div>S t\u00edm, jak se data v data lake hromad\u00ed, se organizace st\u00e1v\u00e1 kritickou. Bez struktury se data lake m\u011bn\u00ed v \u201edatovou ba\u017einu\u201c (data swamp) \u2013 data existuj\u00ed, ale jsou nepou\u017eiteln\u00e1, proto\u017ee nikdo nev\u00ed, co obsahuj\u00ed, odkud poch\u00e1zej\u00ed nebo zda jsou d\u016fv\u011bryhodn\u00e1. Nejpopul\u00e1rn\u011bj\u0161\u00edm organiza\u010dn\u00edm vzorem je <b data-path-to-node=\"35\" data-index-in-node=\"291\">medailonov\u00e1 architektura<\/b> (medallion architecture), kter\u00e1 rozd\u011bluje data lake do z\u00f3n podle zralosti dat.<\/div>\n<ul data-path-to-node=\"36\">\n<li>\n<div><b data-path-to-node=\"36,0,0\" data-index-in-node=\"0\">Bronzov\u00e1 z\u00f3na (Bronze Zone)<\/b> obsahuje syrov\u00e1 data v jejich p\u016fvodn\u00edm form\u00e1tu, p\u0159esn\u011b tak, jak p\u0159i\u0161la ze zdrojov\u00e9ho syst\u00e9mu. \u017d\u00e1dn\u00e9 transformace, \u017e\u00e1dn\u00e9 \u010di\u0161t\u011bn\u00ed, \u017e\u00e1dn\u00e9 vynucov\u00e1n\u00ed sch\u00e9matu. Bronzov\u00e1 z\u00f3na je kompletn\u00edm historick\u00fdm z\u00e1znamem \u2013 pokud se d\u00e1le v \u0159et\u011bzci n\u011bco pokaz\u00ed, v\u017edy m\u016f\u017eete data znovu zpracovat z bronzov\u00e9 z\u00f3ny. Bronzov\u00e1 data jsou typicky organizov\u00e1na podle zdrojov\u00e9ho syst\u00e9mu a data, co\u017e usnad\u0148uje vyhled\u00e1n\u00ed syrov\u00fdch dat ze konkr\u00e9tn\u00edho zdroje v konkr\u00e9tn\u00ed den.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"36,1,0\" data-index-in-node=\"0\">St\u0159\u00edbrn\u00e1 z\u00f3na (Silver Zone)<\/b> obsahuje vy\u010di\u0161t\u011bn\u00e1, deduplikovan\u00e1 a lehce transformovan\u00e1 data. Data byla ov\u011b\u0159ena v\u016f\u010di pravidl\u016fm kvality, osobn\u00ed identifika\u010dn\u00ed \u00fadaje (PII) byly maskov\u00e1ny a byly aplikov\u00e1ny z\u00e1kladn\u00ed transformace (nap\u0159. standardizace form\u00e1t\u016f data, p\u0159evody m\u011bn). St\u0159\u00edbrn\u00e1 data jsou pou\u017eiteln\u011bj\u0161\u00ed ne\u017e bronzov\u00e1, ale st\u00e1le si zachov\u00e1vaj\u00ed historick\u00fd kontext a granularitu. Analytici se \u010dasto dotazuj\u00ed p\u0159\u00edmo na st\u0159\u00edbrn\u00e1 data pro pr\u016fzkumnou anal\u00fdzu.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"36,2,0\" data-index-in-node=\"0\">Zlat\u00e1 z\u00f3na (Gold Zone)<\/b> obsahuje vysoce agregovan\u00e1 data p\u0159ipraven\u00e1 pro obchodn\u00ed \u00fa\u010dely, optimalizovan\u00e1 pro konkr\u00e9tn\u00ed p\u0159\u00edpady pou\u017eit\u00ed. Zlat\u00e1 datov\u00e1 sada m\u016f\u017ee obsahovat denn\u00ed metriky z\u00e1kazn\u00edk\u016f, m\u011bs\u00ed\u010dn\u00ed p\u0159ehledy prodej\u016f nebo p\u0159edem vypo\u010d\u00edtan\u00e9 funkce pro model strojov\u00e9ho u\u010den\u00ed. Zlat\u00e1 data b\u00fdvaj\u00ed men\u0161\u00ed, rychlej\u0161\u00ed na dotazov\u00e1n\u00ed a slad\u011bn\u00e1 s obchodn\u00edmi definicemi. N\u00e1stroje business intelligence \u010dasto konzumuj\u00ed p\u0159\u00edmo zlat\u00e1 data.<\/div>\n<\/li>\n<\/ul>\n<div>Tento medailonov\u00fd vzor p\u0159in\u00e1\u0161\u00ed n\u011bkolik v\u00fdhod. Vytv\u00e1\u0159\u00ed jasn\u00e1 o\u010dek\u00e1v\u00e1n\u00ed ohledn\u011b kvality dat na ka\u017ed\u00e9 \u00farovni. Umo\u017e\u0148uje r\u016fzn\u00fdm t\u00fdm\u016fm pracovat na r\u016fzn\u00fdch \u00farovn\u00edch abstrakce \u2013 datov\u00ed in\u017een\u00fd\u0159i se zam\u011b\u0159uj\u00ed na transformace z bronzov\u00e9 do st\u0159\u00edbrn\u00e9 z\u00f3ny, analytici na transformace ze st\u0159\u00edbrn\u00e9 do zlat\u00e9 a obchodn\u00ed u\u017eivatel\u00e9 konzumuj\u00ed zlat\u00e1 data. Poskytuje tak\u00e9 mechanismus pro n\u00e1vrat zp\u011bt (rollback) \u2013 pokud je transformace nespr\u00e1vn\u00e1, m\u016f\u017eete data znovu zpracovat z d\u0159\u00edv\u011bj\u0161\u00ed z\u00f3ny.<\/div>\n<h3 data-path-to-node=\"39\">Zpracovatelsk\u00e9 a analytick\u00e9 frameworky<\/h3>\n<div>S\u00edla data lake spo\u010d\u00edv\u00e1 v jeho schopnosti podporovat r\u016fznorod\u00e9 zpracovatelsk\u00e9 a analytick\u00e9 z\u00e1t\u011b\u017ee sou\u010dasn\u011b. Stejn\u00e1 syrov\u00e1 data mohou nap\u00e1jet \u0159\u00eddic\u00ed panely v re\u00e1ln\u00e9m \u010dase, d\u00e1vkov\u00e9 modely strojov\u00e9ho u\u010den\u00ed i pr\u016fzkumn\u00e1 \u0161et\u0159en\u00ed datov\u00fdch v\u011bdc\u016f.<\/div>\n<ul data-path-to-node=\"41\">\n<li>\n<div><b data-path-to-node=\"41,0,0\" data-index-in-node=\"0\">D\u00e1vkov\u00e9 zpracov\u00e1n\u00ed (Batch Processing)<\/b> je tradi\u010dn\u00ed p\u0159\u00edstup. Dominantn\u00edm frameworkem je Apache Spark, kter\u00fd datov\u00fdm in\u017een\u00fdr\u016fm umo\u017e\u0148uje ps\u00e1t distribuovan\u00e9 zpracovatelsk\u00e9 \u00falohy, je\u017e \u010dtou data z data lake, aplikuj\u00ed slo\u017eit\u00e9 transformace a zapisuj\u00ed v\u00fdsledky zp\u011bt. D\u00e1vkov\u00e9 \u00falohy jsou pl\u00e1nov\u00e1ny na konkr\u00e9tn\u00ed \u010dasy (nap\u0159. na noc) a dok\u00e1\u017eou efektivn\u011b zpracovat terabajty dat.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"41,1,0\" data-index-in-node=\"0\">Interaktivn\u00ed SQL anal\u00fdza (Interactive SQL Analysis)<\/b> umo\u017e\u0148uje analytik\u016fm dotazovat data v data lake pomoc\u00ed SQL, podobn\u011b jako p\u0159i dotazov\u00e1n\u00ed do datov\u00e9ho skladu. N\u00e1stroje jako Presto, Spark SQL nebo cloudov\u011b nativn\u00ed dotazovac\u00ed stroje (BigQuery, Athena, Synapse Analytics) umo\u017e\u0148uj\u00ed analytik\u016fm spou\u0161t\u011bt ad-hoc dotazy bez \u010dek\u00e1n\u00ed na d\u00e1vkov\u00e9 \u00falohy. To dramaticky zrychluje cyklus z\u00edsk\u00e1v\u00e1n\u00ed poznatk\u016f \u2013 analytik m\u016f\u017ee prozkoumat hypot\u00e9zu b\u011bhem n\u011bkolika minut, m\u00edsto aby \u017e\u00e1dal o d\u00e1vkovou \u00falohu a \u010dekal na v\u00fdsledky.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"41,2,0\" data-index-in-node=\"0\">Streamovac\u00ed analytika v re\u00e1ln\u00e9m \u010dase (Real-Time Streaming Analytics)<\/b> zpracov\u00e1v\u00e1 data p\u0159i jejich p\u0159\u00edchodu, co\u017e umo\u017e\u0148uje z\u00edskat poznatky a reakce v re\u00e1ln\u00e9m \u010dase. Frameworky pro zpracov\u00e1n\u00ed stream\u016f, jako je Apache Flink nebo Spark Streaming, dok\u00e1\u017eou detekovat podvody ve finan\u010dn\u00edch transakc\u00edch, spou\u0161t\u011bt v\u00fdstrahy p\u0159i anom\u00e1li\u00edch sn\u00edma\u010d\u016f nebo personalizovat doporu\u010den\u00ed b\u011bhem toho, co si u\u017eivatel prohl\u00ed\u017e\u00ed web \u2013 to v\u0161e s latenc\u00ed pod jednu sekundu.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"41,3,0\" data-index-in-node=\"0\">Pracovn\u00ed postupy strojov\u00e9ho u\u010den\u00ed (Machine Learning Workflows)<\/b> vyu\u017e\u00edvaj\u00ed data z data lake k tr\u00e9nov\u00e1n\u00ed model\u016f. Datov\u00ed v\u011bdci maj\u00ed p\u0159\u00edm\u00fd p\u0159\u00edstup k syrov\u00fdm, nezpracovan\u00fdm dat\u016fm, co\u017e jim umo\u017e\u0148uje experimentovat s r\u016fzn\u00fdmi p\u0159\u00edstupy k in\u017een\u00fdrstv\u00ed funkc\u00ed (feature engineering). Pln\u00e1 v\u011brnost a kontext syrov\u00fdch dat jsou pro vytv\u00e1\u0159en\u00ed p\u0159esn\u00fdch model\u016f z\u00e1sadn\u00ed. Jakmile je model vytr\u00e9nov\u00e1n, m\u016f\u017ee b\u00fdt nasazen k prov\u00e1d\u011bn\u00ed p\u0159edpov\u011bd\u00ed na nov\u00fdch datech p\u0159ich\u00e1zej\u00edc\u00edch do data lake.<\/div>\n<\/li>\n<\/ul>\n<h2 data-path-to-node=\"43\">Jak se Data Lake li\u0161\u00ed od Data Warehouse?<\/h2>\n<h3 data-path-to-node=\"44\">Strukturn\u00ed rozd\u00edly<\/h3>\n<div>Z\u00e1sadn\u00edm rozd\u00edlem mezi data lakes a datov\u00fdmi sklady je jejich p\u0159\u00edstup ke sch\u00e9matu. <b data-path-to-node=\"45\" data-index-in-node=\"83\">Datov\u00fd sklad<\/b> pou\u017e\u00edv\u00e1 p\u0159\u00edstup schema-on-write: p\u0159ed ulo\u017een\u00edm dat mus\u00ed b\u00fdt definov\u00e1na jejich struktura. Datab\u00e1zov\u00fd administr\u00e1tor navrhne tabulky, sloupce, datov\u00e9 typy a relace. Vlo\u017eena mohou b\u00fdt pouze data odpov\u00eddaj\u00edc\u00ed tomuto p\u0159eddefinovan\u00e9mu sch\u00e9matu. Tento p\u0159\u00edstup zaji\u0161\u0165uje kvalitu a konzistenci dat, ale vy\u017eaduje p\u0159edb\u011b\u017en\u00e9 pl\u00e1nov\u00e1n\u00ed a vytv\u00e1\u0159\u00ed \u00fazk\u00e1 hrdla p\u0159i pot\u0159eb\u011b p\u0159idat nov\u00e9 zdroje dat.<\/div>\n<div><b data-path-to-node=\"46\" data-index-in-node=\"0\">Data lake<\/b> pou\u017e\u00edv\u00e1 p\u0159\u00edstup schema-on-read: data jsou ulo\u017eena v syrov\u00e9m form\u00e1tu bez vynucen\u00ed sch\u00e9matu a struktura je aplikov\u00e1na a\u017e ve chv\u00edli, kdy jsou data \u010dtena pro anal\u00fdzu. Datov\u00fd v\u011bdec se m\u016f\u017ee dot\u00e1zat do data lake a specifikovat: \u201epova\u017euj toto pole JSON za \u010dasov\u00e9 raz\u00edtko\u201c nebo \u201eextrahuj z tohoto pole ID z\u00e1kazn\u00edka\u201c. Tato flexibilita umo\u017e\u0148uje rychlou ingestaci dat, ale p\u0159en\u00e1\u0161\u00ed z\u00e1t\u011b\u017e spojenou s pochopen\u00edm struktury dat na analytika.<\/div>\n<div>Tento rozd\u00edl se propisuje do cel\u00e9ho syst\u00e9mu. Procesy ETL u datov\u00fdch sklad\u016f jsou slo\u017eit\u00e9, proto\u017ee mus\u00ed vynucovat dodr\u017eov\u00e1n\u00ed sch\u00e9matu. Ingestace do data lake m\u016f\u017ee b\u00fdt jednodu\u0161\u0161\u00ed, proto\u017ee syrov\u00e1 data jsou p\u0159ij\u00edm\u00e1na tak, jak jsou. Dotazy do datov\u00e9ho skladu jsou rychl\u00e9, proto\u017ee data jsou p\u0159edem organizovan\u00e1 a indexovan\u00e1. Dotazy do data lake maj\u00ed prom\u011bnliv\u00fd v\u00fdkon, proto\u017ee syst\u00e9m mus\u00ed zpracov\u00e1vat syrov\u00e1 data za chodu. Governance v datov\u00e9m skladu spo\u010d\u00edv\u00e1 ve vynucov\u00e1n\u00ed sch\u00e9matu; governance v data lake spo\u010d\u00edv\u00e1 v metadatech a \u0159\u00edzen\u00ed p\u0159\u00edstupu.<\/div>\n<h3 data-path-to-node=\"49\">Vhodnost pro p\u0159\u00edpady pou\u017eit\u00ed<\/h3>\n<div>Tento architektonick\u00fd rozd\u00edl p\u0159edur\u010duje data lakes a datov\u00e9 sklady pro r\u016fzn\u00e9 p\u0159\u00edpady pou\u017eit\u00ed.<\/div>\n<div><b data-path-to-node=\"51\" data-index-in-node=\"0\">Datov\u00e9 sklady vynikaj\u00ed v oblasti:<\/b><\/div>\n<ul data-path-to-node=\"52\">\n<li>\n<div><b data-path-to-node=\"52,0,0\" data-index-in-node=\"0\">Business Intelligence a reporting<\/b> \u2014 P\u0159eddefinovan\u00e9 reporty, \u0159\u00eddic\u00ed panely a KPI, kter\u00e9 se nem\u011bn\u00ed \u010dasto<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"52,1,0\" data-index-in-node=\"0\">Strukturovan\u00e1 SQL anal\u00fdza<\/b> \u2014 Slo\u017eit\u00e9 dotazy nad strukturovan\u00fdmi, relacn\u00edmi daty<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"52,2,0\" data-index-in-node=\"0\">Aplikace kritick\u00e9 z hlediska v\u00fdkonu<\/b> \u2014 Aplikace vy\u017eaduj\u00edc\u00ed odezvu dotazu pod jednu sekundu<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"52,3,0\" data-index-in-node=\"0\">Dodr\u017eov\u00e1n\u00ed p\u0159edpis\u016f a audit<\/b> \u2014 P\u0159\u00edsn\u00e9 po\u017eadavky na kvalitu dat a auditn\u00ed stopu<\/div>\n<\/li>\n<\/ul>\n<div><b data-path-to-node=\"53\" data-index-in-node=\"0\">Data Lakes vynikaj\u00ed v oblasti:<\/b><\/div>\n<ul data-path-to-node=\"54\">\n<li>\n<div><b data-path-to-node=\"54,0,0\" data-index-in-node=\"0\">Pr\u016fzkumn\u00e1 anal\u00fdza dat<\/b> \u2014 Objevov\u00e1n\u00ed vzorc\u016f a vztah\u016f v datech bez p\u0159eddefinovan\u00fdch hypot\u00e9z<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"54,1,0\" data-index-in-node=\"0\">Strojov\u00e9 u\u010den\u00ed<\/b> \u2014 Tr\u00e9nov\u00e1n\u00ed model\u016f na syrov\u00fdch, nezpracovan\u00fdch datech s pln\u00fdm historick\u00fdm kontextem<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"54,2,0\" data-index-in-node=\"0\">Zpracov\u00e1n\u00ed velk\u00fdch dat (Big Data)<\/b> \u2014 N\u00e1kladov\u011b efektivn\u00ed zpracov\u00e1n\u00ed terabajt\u016f nebo petabajt\u016f dat<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"54,3,0\" data-index-in-node=\"0\">R\u016fznorod\u00e9 typy dat<\/b> \u2014 Ukl\u00e1d\u00e1n\u00ed a anal\u00fdza strukturovan\u00fdch, polostrukturovan\u00fdch a nestrukturovan\u00fdch dat (obr\u00e1zky, videa, text)<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"54,4,0\" data-index-in-node=\"0\">Analytika v re\u00e1ln\u00e9m \u010dase<\/b> \u2014 Zpracov\u00e1n\u00ed streamovan\u00fdch dat pro okam\u017eit\u00e9 poznatky<\/div>\n<\/li>\n<\/ul>\n<div>V praxi v\u011bt\u0161ina vysp\u011bl\u00fdch organizac\u00ed pou\u017e\u00edv\u00e1 oboj\u00ed. Datov\u00fd sklad poskytuje strukturovan\u00e1, optimalizovan\u00e1 data pro b\u011b\u017en\u00fd podnikovou reporting. Data lake poskytuje syrov\u00fd materi\u00e1l pro experimentov\u00e1n\u00ed, strojov\u00e9 u\u010den\u00ed a objevov\u00e1n\u00ed. Data proud\u00ed z data lake (syrov\u00e1 data) p\u0159es zpracovatelsk\u00e9 kan\u00e1ly do datov\u00e9ho skladu (rafinovan\u00e1, optimalizovan\u00e1 data) a odtud do n\u00e1stroj\u016f business intelligence (reporty a \u0159\u00eddic\u00ed panely).<\/div>\n<table data-path-to-node=\"56\">\n<thead>\n<tr>\n<td><strong>Dimenze<\/strong><\/td>\n<td><strong>Data Lake<\/strong><\/td>\n<td><strong>Data Warehouse<\/strong><\/td>\n<td><strong>Lakehouse<\/strong><\/td>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><span data-path-to-node=\"56,1,0,0\"><b data-path-to-node=\"56,1,0,0\" data-index-in-node=\"0\">Architektura<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,1,1,0\">Ploch\u00e9, objektov\u00e9 \u00falo\u017ei\u0161t\u011b<\/span><\/td>\n<td><span data-path-to-node=\"56,1,2,0\">Hierarchick\u00e1, relacn\u00ed\/dimenzion\u00e1ln\u00ed<\/span><\/td>\n<td><span data-path-to-node=\"56,1,3,0\">Hybridn\u00ed \u2014 ploch\u00e9 \u00falo\u017ei\u0161t\u011b s s\u00e9mantikou skladu<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,2,0,0\"><b data-path-to-node=\"56,2,0,0\" data-index-in-node=\"0\">P\u0159\u00edstup ke sch\u00e9matu<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,2,1,0\">Schema-on-read<\/span><\/td>\n<td><span data-path-to-node=\"56,2,2,0\">Schema-on-write<\/span><\/td>\n<td><span data-path-to-node=\"56,2,3,0\">Schema-on-write s flexibilitou<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,3,0,0\"><b data-path-to-node=\"56,3,0,0\" data-index-in-node=\"0\">Form\u00e1t dat<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,3,1,0\">Syrov\u00fd, jak\u00fdkoli form\u00e1t<\/span><\/td>\n<td><span data-path-to-node=\"56,3,2,0\">Strukturovan\u00e1, vy\u010di\u0161t\u011bn\u00e1, transformovan\u00e1<\/span><\/td>\n<td><span data-path-to-node=\"56,3,3,0\">Syrov\u00e1 i strukturovan\u00e1 (podporuje oboj\u00ed)<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,4,0,0\"><b data-path-to-node=\"56,4,0,0\" data-index-in-node=\"0\">N\u00e1klady<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,4,1,0\">N\u00edzk\u00e9 (levn\u00e9 \u00falo\u017ei\u0161t\u011b)<\/span><\/td>\n<td><span data-path-to-node=\"56,4,2,0\">Vy\u0161\u0161\u00ed (optimalizovan\u00e9, indexovan\u00e9 \u00falo\u017ei\u0161t\u011b)<\/span><\/td>\n<td><span data-path-to-node=\"56,4,3,0\">N\u00edzk\u00e9 a\u017e m\u00edrn\u00e9<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,5,0,0\"><b data-path-to-node=\"56,5,0,0\" data-index-in-node=\"0\">V\u00fdkon dotaz\u016f<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,5,1,0\">Prom\u011bnliv\u00fd, pomalej\u0161\u00ed u syrov\u00fdch dat<\/span><\/td>\n<td><span data-path-to-node=\"56,5,2,0\">Rychl\u00fd, optimalizovan\u00fd pro b\u011b\u017en\u00e9 dotazy<\/span><\/td>\n<td><span data-path-to-node=\"56,5,3,0\">Rychl\u00fd, optimalizovan\u00fd s p\u0159\u00edstupem k syrov\u00fdm dat\u016fm<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,6,0,0\"><b data-path-to-node=\"56,6,0,0\" data-index-in-node=\"0\">ACID transakce<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,6,1,0\">Omezen\u00e9 nebo \u017e\u00e1dn\u00e9<\/span><\/td>\n<td><span data-path-to-node=\"56,6,2,0\">Pln\u00e1 podpora ACID<\/span><\/td>\n<td><span data-path-to-node=\"56,6,3,0\">Pln\u00e1 podpora ACID<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,7,0,0\"><b data-path-to-node=\"56,7,0,0\" data-index-in-node=\"0\">Governance dat<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,7,1,0\">Zalo\u017een\u00e1 na metadatech, flexibiln\u00ed<\/span><\/td>\n<td><span data-path-to-node=\"56,7,2,0\">Zalo\u017een\u00e1 na sch\u00e9matu, p\u0159\u00edsn\u00e1<\/span><\/td>\n<td><span data-path-to-node=\"56,7,3,0\">Hybridn\u00ed \u2014 jak metadata, tak sch\u00e9ma<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,8,0,0\"><b data-path-to-node=\"56,8,0,0\" data-index-in-node=\"0\">Hlavn\u00ed p\u0159\u00edpady pou\u017eit\u00ed<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,8,1,0\">ML, pr\u016fzkum, big data<\/span><\/td>\n<td><span data-path-to-node=\"56,8,2,0\">BI, reporting, analytika<\/span><\/td>\n<td><span data-path-to-node=\"56,8,3,0\">V\u0161e v\u00fd\u0161e uveden\u00e9<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,9,0,0\"><b data-path-to-node=\"56,9,0,0\" data-index-in-node=\"0\">\u010cas na z\u00edsk\u00e1n\u00ed poznatk\u016f<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,9,1,0\">Pomal\u011bj\u0161\u00ed po\u010d\u00e1te\u010dn\u00ed, rychlej\u0161\u00ed iterace<\/span><\/td>\n<td><span data-path-to-node=\"56,9,2,0\">Rychl\u00fd pro p\u0159eddefinovan\u00e9 dotazy<\/span><\/td>\n<td><span data-path-to-node=\"56,9,3,0\">Rychl\u00fd pro v\u0161echny typy dotaz\u016f<\/span><\/td>\n<\/tr>\n<tr>\n<td><span data-path-to-node=\"56,10,0,0\"><b data-path-to-node=\"56,10,0,0\" data-index-in-node=\"0\">Zralost<\/b><\/span><\/td>\n<td><span data-path-to-node=\"56,10,1,0\">Zral\u00e9 (10+ let)<\/span><\/td>\n<td><span data-path-to-node=\"56,10,2,0\">Velmi zral\u00e9 (20+ let)<\/span><\/td>\n<td><span data-path-to-node=\"56,10,3,0\">Vznikaj\u00edc\u00ed (3\u20135 let)<\/span><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2 data-path-to-node=\"58\">Jak\u00e9 jsou hlavn\u00ed v\u00fdhody Data Lake?<\/h2>\n<h3 data-path-to-node=\"59\">N\u00e1kladov\u00e1 efektivita a \u0161k\u00e1lovatelnost<\/h3>\n<div>Jedn\u00edm z hlavn\u00edch faktor\u016f pro p\u0159ijet\u00ed data lake je ekonomika. Objektov\u00e9 \u00falo\u017ei\u0161t\u011b stoj\u00ed zlomek ceny tradi\u010dn\u00edho datov\u00e9ho skladu. Ve velk\u00e9m m\u011b\u0159\u00edtku se tento rozd\u00edl st\u00e1v\u00e1 dramatick\u00fdm. Ulo\u017een\u00ed petabajtu dat v tradi\u010dn\u00edm datov\u00e9m skladu m\u016f\u017ee ro\u010dn\u011b st\u00e1t miliony dolar\u016f. Stejn\u00fd petabajt v cloudov\u00e9m objektov\u00e9m \u00falo\u017ei\u0161ti stoj\u00ed des\u00edtky tis\u00edc dolar\u016f.<\/div>\n<div>Tento cenov\u00fd rozd\u00edl umo\u017e\u0148uje z\u00e1sadn\u011b odli\u0161n\u00fd p\u0159\u00edstup k uchov\u00e1v\u00e1n\u00ed dat. V datov\u00e9m skladu organizace pe\u010dliv\u011b vyb\u00edraj\u00ed, kter\u00e1 data si ponechaj\u00ed, a syrov\u00e1 data po anal\u00fdze ma\u017eou, aby \u0159\u00eddily n\u00e1klady. V data lake si m\u016f\u017eete dovolit uchovat v\u0161e \u2013 syrov\u00e9 ode\u010dty ze sn\u00edma\u010d\u016f, kompletn\u00ed transak\u010dn\u00ed logy, historick\u00e9 verze referen\u010dn\u00edch dat. Toto komprehensivn\u00ed uchov\u00e1v\u00e1n\u00ed umo\u017e\u0148uje retrospektivn\u00ed anal\u00fdzu. Datov\u00fd v\u011bdec se m\u016f\u017ee zeptat \u201ejak\u00e9 vzorce vedly k tomuto odchodu z\u00e1kazn\u00edk\u016f?\u201c a b\u00fdt schopen analyzovat dva roky historick\u00e9ho chov\u00e1n\u00ed, proto\u017ee syrov\u00e1 data nebyla nikdy smaz\u00e1na.<\/div>\n<div>\u0160k\u00e1lovatelnost je stejn\u011b d\u016fle\u017eit\u00e1. Datov\u00fd sklad m\u00e1 praktick\u00e9 limity \u2013 v ur\u010dit\u00e9m okam\u017eiku p\u0159id\u00e1n\u00ed dal\u0161\u00edch dat dotazy zpomal\u00ed a prodra\u017e\u00ed. Data lake vyu\u017e\u00edvaj\u00edc\u00ed cloudov\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b m\u016f\u017ee r\u016fst na petabajty nebo exabajty bez poklesu v\u00fdkonu. Nekupujete dal\u0161\u00ed \u00falo\u017enou kapacitu; jednodu\u0161e vyu\u017e\u00edv\u00e1te v\u00edce z neomezen\u00e9ho fondu cloudov\u00e9ho poskytovatele. Tato elasticita je nezbytn\u00e1 pro organizace s rychle rostouc\u00edmi objemy dat.<\/div>\n<h3 data-path-to-node=\"64\">Flexibilita a agilita<\/h3>\n<div>Data lakes umo\u017e\u0148uj\u00ed organiza\u010dn\u00ed agilitu t\u00edm, \u017ee odstra\u0148uj\u00ed p\u0159ek\u00e1\u017eku v podob\u011b p\u0159\u00edstupu \u201enejprve sch\u00e9ma\u201c. Jakmile je k dispozici nov\u00fd zdroj dat \u2013 nov\u00e9 API, nov\u00fd typ sn\u00edma\u010de, nov\u00fd podnikov\u00fd syst\u00e9m \u2013, lze jej okam\u017eit\u011b ingestovat v jeho syrov\u00e9m form\u00e1tu. \u017d\u00e1dn\u00fd n\u00e1vrh sch\u00e9matu, \u017e\u00e1dn\u00fd schvalovac\u00ed proces, \u017e\u00e1dn\u00e9 \u010dek\u00e1n\u00ed na IT. Datov\u00fd v\u011bdec m\u016f\u017ee za\u010d\u00edt analyzovat nov\u00e1 data b\u011bhem hodin, nikoli t\u00fddn\u016f.<\/div>\n<div>Tato flexibilita je v rychle se rozv\u00edjej\u00edc\u00edch odv\u011btv\u00edch z\u00e1sadn\u00ed. Spole\u010dnost poskytuj\u00edc\u00ed finan\u010dn\u00ed slu\u017eby m\u016f\u017ee cht\u00edt analyzovat alternativn\u00ed zdroje dat (satelitn\u00ed sn\u00edmky, transakce kreditn\u00edmi kartami, n\u00e1ladu na soci\u00e1ln\u00edch s\u00edt\u00edch) k p\u0159edv\u00edd\u00e1n\u00ed pohyb\u016f na trhu. Maloobchodn\u00ed spole\u010dnost m\u016f\u017ee cht\u00edt ingestovat data ze sn\u00edma\u010d\u016f IoT z prodejen za \u00fa\u010delem optimalizace z\u00e1sob v re\u00e1ln\u00e9m \u010dase. Zdravotnick\u00e1 organizace m\u016f\u017ee cht\u00edt analyzovat genomick\u00e1 data pacient\u016f spole\u010dn\u011b s klinick\u00fdmi z\u00e1znamy. Data lake to v\u0161e pojme bez nutnosti p\u0159edb\u011b\u017en\u00e9ho n\u00e1vrhu sch\u00e9matu.<\/div>\n<div>Flexibilita se roz\u0161i\u0159uje i na analytick\u00e9 p\u0159\u00edstupy. Stejn\u00e9 data lake m\u016f\u017ee podporovat tradi\u010dn\u00ed business intelligence (SQL dotazy nad strukturovan\u00fdmi daty), strojov\u00e9 u\u010den\u00ed (syrov\u00e1 data pro tr\u00e9nov\u00e1n\u00ed model\u016f) a pr\u016fzkumnou anal\u00fdzu (datov\u00ed v\u011bdci experimentuj\u00edc\u00ed s nov\u00fdmi hypot\u00e9zami). R\u016fzn\u00e9 t\u00fdmy mohou pou\u017e\u00edvat stejn\u00e1 podkladov\u00e1 data r\u016fzn\u00fdmi zp\u016fsoby.<\/div>\n<h3 data-path-to-node=\"69\">Podpora strojov\u00e9ho u\u010den\u00ed a AI<\/h3>\n<div>Data lakes jsou zvl\u00e1\u0161t\u011b v\u00fdkonn\u00e9 pro strojov\u00e9 u\u010den\u00ed, proto\u017ee zachov\u00e1vaj\u00ed plnou v\u011brnost a kontext syrov\u00fdch dat. Modely strojov\u00e9ho u\u010den\u00ed jsou ve sv\u00e9 podstat\u011b stroje na rozpozn\u00e1v\u00e1n\u00ed vzorc\u016f. \u010c\u00edm kompletn\u011bj\u0161\u00ed a rozmanit\u011bj\u0161\u00ed jsou tr\u00e9novac\u00ed data, t\u00edm lep\u0161\u00ed je model.<\/div>\n<div>V tradi\u010dn\u00edm datov\u00e9m skladu byla data vy\u010di\u0161t\u011bna, agregov\u00e1na a transformov\u00e1na pro podnikov\u00fd reporting. P\u0159i tomto p\u0159edzpracov\u00e1n\u00ed doch\u00e1z\u00ed ke ztr\u00e1t\u011b informac\u00ed. Transak\u010dn\u00ed \u010d\u00e1stka m\u016f\u017ee b\u00fdt zaokrouhlena na cel\u00e9 dolary; \u010dasov\u00e9 raz\u00edtko m\u016f\u017ee b\u00fdt zkr\u00e1ceno na hodiny. Pro podnikov\u00fd reporting je to v po\u0159\u00e1dku. Pro strojov\u00e9 u\u010den\u00ed je tato ztr\u00e1ta v\u011brnosti problematick\u00e1. Model vytr\u00e9novan\u00fd na zaokrouhlen\u00fdch transak\u010dn\u00edch \u010d\u00e1stk\u00e1ch m\u016f\u017ee p\u0159ehl\u00e9dnout d\u016fle\u017eit\u00e9 vzorce v hal\u00e9\u0159ov\u00fdch nebo centov\u00fdch polo\u017ek\u00e1ch, kter\u00e9 indikuj\u00ed podvod.<\/div>\n<div>Data lakes tuto plnou v\u011brnost zachov\u00e1vaj\u00ed. Syrov\u00e1 transak\u010dn\u00ed data obsahuj\u00ed p\u0159esn\u00e9 \u010d\u00e1stky, p\u0159esn\u00e1 \u010dasov\u00e1 raz\u00edtka, kompletn\u00ed historii z\u00e1kazn\u00edka a v\u0161echny ostatn\u00ed detaily. Datov\u00ed v\u011bdci mohou experimentovat s r\u016fzn\u00fdmi p\u0159\u00edstupy k in\u017een\u00fdrstv\u00ed funkc\u00ed a objevovat, kter\u00e9 datov\u00e9 prvky maj\u00ed nejvy\u0161\u0161\u00ed vypov\u00eddaj\u00edc\u00ed hodnotu. Tento experiment\u00e1ln\u00ed cyklus je v data lake rychl\u00fd, proto\u017ee syrov\u00e1 data jsou okam\u017eit\u011b p\u0159\u00edstupn\u00e1.<\/div>\n<div>Data lakes nav\u00edc mohou ukl\u00e1dat r\u016fznorod\u00e9 typy dat \u2013 obr\u00e1zky, videa, text, data ze sn\u00edma\u010d\u016f, kan\u00e1ly ze soci\u00e1ln\u00edch s\u00edt\u00ed. Modern\u00ed modely strojov\u00e9ho u\u010den\u00ed (deep learning, transformery, velk\u00e9 jazykov\u00e9 modely) prosperuj\u00ed na rozmanit\u00fdch, nestrukturovan\u00fdch datech. Data lake umo\u017e\u0148uje tr\u00e9nov\u00e1n\u00ed t\u011bchto pokro\u010dil\u00fdch model\u016f t\u00edm, \u017ee poskytuje p\u0159\u00edstup k syrov\u00fdm dat\u016fm v jejich p\u016fvodn\u00ed podob\u011b.<\/div>\n<h3 data-path-to-node=\"75\">Analytika a poznatky v re\u00e1ln\u00e9m \u010dase<\/h3>\n<div>Data lakes podporuj\u00ed streamovanou analytiku v re\u00e1ln\u00e9m \u010dase, co\u017e organizac\u00edm umo\u017e\u0148uje reagovat na ud\u00e1losti okam\u017eit\u011b, kdy\u017e nastanou. Finan\u010dn\u00ed instituce m\u016f\u017ee detekovat podvodn\u00e9 transakce v re\u00e1ln\u00e9m \u010dase a zablokovat je d\u0159\u00edve, ne\u017e dokon\u010d\u00ed. E-commerce platforma m\u016f\u017ee personalizovat doporu\u010den\u00ed produkt\u016f p\u0159\u00edmo b\u011bhem prohl\u00ed\u017een\u00ed z\u00e1kazn\u00edka. V\u00fdrobn\u00ed z\u00e1vod dok\u00e1\u017ee detekovat anom\u00e1lie za\u0159\u00edzen\u00ed je\u0161t\u011b p\u0159ed vznikem poruchy.<\/div>\n<div>Tato schopnost v re\u00e1ln\u00e9m \u010dase je umo\u017en\u011bna podporou data lake pro ingestaci a zpracov\u00e1n\u00ed streamovan\u00fdch dat. Data p\u0159ich\u00e1zej\u00ed nep\u0159etr\u017eit\u011b, jsou okam\u017eit\u011b zpracov\u00e1na a poznatky jsou k dispozici b\u011bhem milisekund. Tato rychlost odezvy vytv\u00e1\u0159\u00ed konkuren\u010dn\u00ed v\u00fdhodu.<\/div>\n<h2 data-path-to-node=\"79\">S jak\u00fdmi v\u00fdzvami se organizace u Data Lakes pot\u00fdkaj\u00ed?<\/h2>\n<h3 data-path-to-node=\"80\">Governance a kvalita dat<\/h3>\n<div>Flexibilita data lakes s sebou nese da\u0148 v podob\u011b slo\u017eit\u011bj\u0161\u00ed governance. Bez pe\u010dliv\u00e9 spr\u00e1vy se data lake prom\u011bn\u00ed v \u201edatovou ba\u017einu\u201c \u2013 data existuj\u00ed, ale jsou nepou\u017eiteln\u00e1, proto\u017ee nikdo nev\u00ed, co obsahuj\u00ed, odkud poch\u00e1zej\u00ed nebo zda jsou d\u016fv\u011bryhodn\u00e1.<\/div>\n<div>Hlavn\u00ed v\u00fdzvou v oblasti governance je spr\u00e1va metadaty. V datov\u00e9m skladu sch\u00e9ma poskytuje implicitn\u00ed dokumentaci \u2013 n\u00e1zvy sloupc\u016f, datov\u00e9 typy a relace jsou samodokumentuj\u00edc\u00ed. V data lake tato implicitn\u00ed dokumentace neexistuje. Pot\u0159ebujete explicitn\u00ed metadata: co toto pole p\u0159edstavuje? Jak\u00fd je zdrojov\u00fd syst\u00e9m? Kdy bylo naposledy aktualizov\u00e1no? Kdo k n\u011bmu m\u00e1 p\u0159\u00edstup? Jak\u00e9 standardy kvality spl\u0148uje?<\/div>\n<div>Spr\u00e1va t\u011bchto metadaty ve velk\u00e9m m\u011b\u0159\u00edtku nen\u00ed trivi\u00e1ln\u00ed. Velk\u00e9 data lake m\u016f\u017ee obsahovat tis\u00edce datov\u00fdch sad, z nich\u017e ka\u017ed\u00e1 m\u00e1 sv\u00e9 vlastn\u00ed po\u017eadavky na metadata. N\u00e1stroje jako datov\u00e9 katalogy (Collibra, Alation, Apache Atlas) pom\u00e1haj\u00ed, ale vy\u017eaduj\u00ed zna\u010dn\u00e9 \u00fasil\u00ed p\u0159i implementaci a \u00fadr\u017eb\u011b. Metadata mus\u00ed b\u00fdt p\u0159esn\u00e1 a aktu\u00e1ln\u00ed, co\u017e znamen\u00e1 zaveden\u00ed proces\u016f a odpov\u011bdnosti za jejich kvalitu.<\/div>\n<div>Dal\u0161\u00ed v\u00fdzvou governance je kvalita dat. V datov\u00e9m skladu je kvalita vynucov\u00e1na p\u0159i ingestaci \u2013 data jsou ov\u011b\u0159ov\u00e1na p\u0159ed vstupem do skladu. V data lake je vynucov\u00e1n\u00ed kvality distribuovan\u00e9. N\u011bkter\u00e9 kontroly kvality mohou prob\u00edhat b\u011bhem ingestace, jin\u00e9 b\u011bhem zpracov\u00e1n\u00ed, dal\u0161\u00ed b\u011bhem konzumace. Tento distribuovan\u00fd p\u0159\u00edstup je flexibiln\u00ed, ale vytv\u00e1\u0159\u00ed prostor pro to, aby probl\u00e9my s kvalitou proklouzly.<\/div>\n<div>Princip \u201egarbage in, garbage out\u201c plat\u00ed pro data lakes se zvl\u00e1\u0161tn\u00ed silou. Pokud syrov\u00e1 data obsahuj\u00ed chyby, chyb\u011bj\u00edc\u00ed hodnoty nebo nekonzistence, propaguj\u00ed se do v\u0161ech navazuj\u00edc\u00edch anal\u00fdz. Stanoven\u00ed standard\u016f kvality dat, monitorov\u00e1n\u00ed kvality a odstra\u0148ov\u00e1n\u00ed probl\u00e9m\u016f vy\u017eaduje soustavn\u00e9 \u00fasil\u00ed.<\/div>\n<h3 data-path-to-node=\"87\">Bezpe\u010dnost a dodr\u017eov\u00e1n\u00ed p\u0159edpis\u016f (Compliance)<\/h3>\n<div>Data lakes \u010dasto obsahuj\u00ed citliv\u00e1 data \u2013 osobn\u00ed identifika\u010dn\u00ed \u00fadaje (PII), finan\u010dn\u00ed data, zdravotn\u00ed z\u00e1znamy, du\u0161evn\u00ed vlastnictv\u00ed. Ochrana t\u011bchto dat p\u0159i sou\u010dasn\u00e9m umo\u017en\u011bn\u00ed autorizovan\u00e9ho p\u0159\u00edstupu p\u0159edstavuje z\u00e1sadn\u00ed v\u00fdzvu.<\/div>\n<div>Prvn\u00ed v\u00fdzvou je <b data-path-to-node=\"89\" data-index-in-node=\"16\">\u0159\u00edzen\u00fd p\u0159\u00edstup<\/b>. V datov\u00e9m skladu je \u0159\u00edzen\u00ed p\u0159\u00edstupu relativn\u011b p\u0159\u00edmo\u010dar\u00e9 \u2013 ud\u011bl\u00edte u\u017eivatel\u016fm p\u0159\u00edstup ke konkr\u00e9tn\u00edm tabulk\u00e1m nebo pohled\u016fm. V data lake jsou data granul\u00e1rn\u011bj\u0161\u00ed. Mo\u017en\u00e1 budete muset \u0159\u00eddit p\u0159\u00edstup na \u00farovni soubor\u016f, objekt\u016f nebo dokon\u010de pol\u00ed (nap\u0159. maskovat jm\u00e9na z\u00e1kazn\u00edk\u016f, ale povolit p\u0159\u00edstup k transak\u010dn\u00edm \u010d\u00e1stk\u00e1m). Implementace jemn\u011b odstup\u0148ovan\u00e9ho \u0159\u00edzen\u00ed p\u0159\u00edstupu (fine-grained access control) ve velk\u00e9m m\u011b\u0159\u00edtku je slo\u017eit\u00e1.<\/div>\n<div>Druhou v\u00fdzvou je <b data-path-to-node=\"90\" data-index-in-node=\"17\">\u0161ifrov\u00e1n\u00ed<\/b>. Data mus\u00ed b\u00fdt \u0161ifrov\u00e1na jak p\u0159i p\u0159enosu (p\u0159i pohybu ze zdrojov\u00fdch syst\u00e9m\u016f do data lake), tak v klidu (p\u0159i ulo\u017een\u00ed v data lake). \u0160ifrov\u00e1n\u00ed p\u0159id\u00e1v\u00e1 v\u00fdpo\u010detn\u00ed re\u017eii a slo\u017eitost p\u0159i spr\u00e1v\u011b kl\u00ed\u010d\u016f. Kdo spravuje \u0161ifrovac\u00ed kl\u00ed\u010de? Jak prob\u00edh\u00e1 rotace kl\u00ed\u010d\u016f? Co se stane, pokud dojde k kompromitaci kl\u00ed\u010de?<\/div>\n<div>T\u0159et\u00ed v\u00fdzvou je <b data-path-to-node=\"91\" data-index-in-node=\"16\">dodr\u017eov\u00e1n\u00ed p\u0159edpis\u016f<\/b>. Regulace jako GDPR, HIPAA a SOC 2 ukl\u00e1daj\u00ed specifick\u00e9 po\u017eadavky na nakl\u00e1d\u00e1n\u00ed s daty. Pr\u00e1vo GDPR \u201eb\u00fdt zapomenut\u201c znamen\u00e1, \u017ee mo\u017en\u00e1 budete muset na \u017e\u00e1dost smazat ve\u0161ker\u00e1 data o konkr\u00e9tn\u00edm jednotlivci. HIPAA vy\u017eaduje auditn\u00ed stopy ukazuj\u00edc\u00ed, kdo, kdy a k jak\u00fdm dat\u016fm p\u0159istupoval. Implementace t\u011bchto po\u017eadavk\u016f v data lake vy\u017eaduje pe\u010dlivou architekturu a n\u00e1stroje.<\/div>\n<h3 data-path-to-node=\"93\">Slo\u017eitost a po\u017eadavky na dovednosti<\/h3>\n<div>Budov\u00e1n\u00ed a provoz produk\u010dn\u00edho data lake vy\u017eaduje specializovan\u00e9 dovednosti. Datov\u00ed in\u017een\u00fd\u0159i mus\u00ed rozum\u011bt distribuovan\u00fdm syst\u00e9m\u016fm, orchestraci datov\u00fdch kan\u00e1l\u016f a framework\u016fm pro zpracov\u00e1n\u00ed velk\u00fdch dat. Datov\u00ed v\u011bdci pot\u0159ebuj\u00ed dovednosti v oblasti strojov\u00e9ho u\u010den\u00ed a statistick\u00e9 anal\u00fdzy. Specialist\u00e9 na governance dat mus\u00ed rozum\u011bt spr\u00e1v\u011b metadaty a kvalit\u011b dat. Provoz IT mus\u00ed spravovat cloudovou infrastrukturu, bezpe\u010dnost a compliance.<\/div>\n<div>Mnoho organizac\u00ed m\u00e1 probl\u00e9m tyto dovednosti sehnat. Trh pr\u00e1ce pro datov\u00e9 in\u017een\u00fdry a datov\u00e9 v\u011bdce je velmi konkuren\u010dn\u00ed a platy jsou vysok\u00e9. Ekosyst\u00e9m n\u00e1stroj\u016f je nav\u00edc rozt\u0159\u00ed\u0161t\u011bn\u00fd. Neexistuje \u017e\u00e1dn\u00e1 jedin\u00e1 \u201eplatforma data lake\u201c \u2013 m\u00edsto toho sestavujete stoh n\u00e1stroj\u016f: cloudov\u00e9 \u00falo\u017ei\u0161t\u011b (S3, Blob Storage), zpracovatelsk\u00e9 stroje (Spark, Flink), dotazovac\u00ed stroje (Presto, Athena), datov\u00e9 katalogy (Collibra, Alation) a orchestra\u010dn\u00ed n\u00e1stroje (Airflow, Databricks Workflows). Ka\u017ed\u00fd n\u00e1stroj m\u00e1 vlastn\u00ed k\u0159ivku u\u010den\u00ed a provozn\u00ed po\u017eadavky.<\/div>\n<div>Tato slo\u017eitost vytv\u00e1\u0159\u00ed organiza\u010dn\u00ed p\u0159ek\u00e1\u017eky. Projekty \u010dasto trvaj\u00ed d\u00e9le a stoj\u00ed v\u00edce, ne\u017e se o\u010dek\u00e1valo. N\u00e1bor a udr\u017een\u00ed kvalifikovan\u00fdch pracovn\u00edk\u016f je obt\u00ed\u017en\u00e9. Mezery v znalostech vedou ke \u0161patn\u00fdm architektonick\u00fdm rozhodnut\u00edm, jejich\u017e n\u00e1prava je pozd\u011bji n\u00e1kladn\u00e1.<\/div>\n<h3 data-path-to-node=\"98\">Spr\u00e1va n\u00e1klad\u016f a v\u00fdkon<\/h3>\n<div>A\u010dkoli je samotn\u00e9 \u00falo\u017ei\u0161t\u011b data lake levn\u00e9, celkov\u00e9 n\u00e1klady na vlastnictv\u00ed (TCO) mohou b\u00fdt zna\u010dn\u00e9. V\u00fdpo\u010detn\u00ed n\u00e1klady na zpracov\u00e1n\u00ed dat mohou p\u0159ekro\u010dit n\u00e1klady na \u00falo\u017ei\u0161t\u011b. Jedin\u00e1 \u00faloha Spark zpracov\u00e1vaj\u00edc\u00ed petabajt dat m\u016f\u017ee spot\u0159ebovat tis\u00edce dolar\u016f ve v\u00fdpo\u010detn\u00edch zdroj\u00edch. Vyn\u00e1sobeno stovkami analytik\u016f a datov\u00fdch v\u011bdc\u016f spou\u0161t\u011bj\u00edc\u00edch dotazy a \u00falohy se n\u00e1klady mohou vymknout kontrole.<\/div>\n<div>Dal\u0161\u00ed v\u00fdzvou je v\u00fdkon. Dotaz v data lake, kter\u00fd proch\u00e1z\u00ed petabajt syrov\u00fdch dat, m\u016f\u017ee trvat hodiny, zat\u00edmco dotaz v datov\u00e9m skladu nad p\u0159edem agregovan\u00fdmi daty m\u016f\u017ee trvat sekundy. Tento rozd\u00edl ve v\u00fdkonu je p\u0159ijateln\u00fd pro pr\u016fzkumnou anal\u00fdzu, ale problematick\u00fd pro provozn\u00ed aplikace vy\u017eaduj\u00edc\u00ed odezvu pod jednu sekundu.<\/div>\n<div>\u0158\u00edzen\u00ed n\u00e1klad\u016f vy\u017eaduje discipl\u00ednu. Pot\u0159ebujete mechanismy k monitorov\u00e1n\u00ed n\u00e1klad\u016f na dotazy, nastavov\u00e1n\u00ed rozpo\u010dt\u016f a zabr\u00e1n\u011bn\u00ed nekontrolovan\u00fdm dotaz\u016fm. Mus\u00edte optimalizovat rozvr\u017een\u00ed dat a kompresi, abyste sn\u00ed\u017eili objem skenovan\u00fdch dat. Mus\u00edte d\u011blat inteligentn\u00ed rozhodnut\u00ed o tom, kter\u00e1 data uchov\u00e1vat v rychl\u00e9m (drah\u00e9m) \u00falo\u017ei\u0161ti oproti pomal\u00e9mu (levn\u00e9mu) \u00falo\u017ei\u0161ti.<\/div>\n<h2 data-path-to-node=\"103\">Jak vybudovat a implementovat Data Lake?<\/h2>\n<h3 data-path-to-node=\"104\">Strategick\u00e9 pl\u00e1nov\u00e1n\u00ed a posouzen\u00ed<\/h3>\n<div>\u00dasp\u011b\u0161n\u00e9 implementace data lake za\u010d\u00ednaj\u00ed jasnou strategi\u00ed. P\u0159ed v\u00fdb\u011brem n\u00e1stroj\u016f nebo budov\u00e1n\u00edm infrastruktury by organizace m\u011bly definovat obchodn\u00ed c\u00edle. Jak\u00e9 probl\u00e9my bude data lake \u0159e\u0161it? Jak\u00e9 poznatky se sna\u017e\u00edte vygenerovat? Jak\u00e1 rozhodnut\u00ed se zlep\u0161\u00ed d\u00edky lep\u0161\u00edmu p\u0159\u00edstupu k dat\u016fm?<\/div>\n<div>F\u00e1ze posouzen\u00ed zahrnuje pochopen\u00ed sou\u010dasn\u00e9ho datov\u00e9ho prost\u0159ed\u00ed. Jak\u00e9 zdroje dat existuj\u00ed? Jak\u00e1 je jejich kvalita a dostupnost? Jak\u00e9 jsou nejv\u011bt\u0161\u00ed probl\u00e9my spojen\u00e9 s daty? Jak\u00e1 je technick\u00e1 zralost organizace? Jak\u00e9 dovednosti existuj\u00ed intern\u011b?<\/div>\n<div>Na z\u00e1klad\u011b tohoto posouzen\u00ed definujte f\u00e1zovan\u00fd pl\u00e1n implementace. V\u011bt\u0161ina \u00fasp\u011b\u0161n\u00fdch implementac\u00ed za\u010d\u00edn\u00e1 v mal\u00e9m \u2013 pilotn\u00edm projektem \u0159e\u0161\u00edc\u00edm konkr\u00e9tn\u00ed obchodn\u00ed probl\u00e9m \u2013, ne\u017e aby se hned pokou\u0161ela vybudovat celopodnikov\u00e9 data lake. Pilot se m\u016f\u017ee zam\u011b\u0159it na jedin\u00fd zdroj dat (nap\u0159. data ze sn\u00edma\u010d\u016f IoT ve v\u00fdrob\u011b) a konkr\u00e9tn\u00ed p\u0159\u00edpad pou\u017eit\u00ed (nap\u0159. prediktivn\u00ed \u00fadr\u017ebu). \u00dasp\u011bch pilota vytv\u00e1\u0159\u00ed podporu nap\u0159\u00ed\u010d organizac\u00ed pro \u0161ir\u0161\u00ed implementaci.<\/div>\n<h3 data-path-to-node=\"109\">N\u00e1vrh architektury<\/h3>\n<div>Rozhodnut\u00ed o architektu\u0159e data lake jsou z\u00e1sadn\u00ed. Prvn\u00edm rozhodnut\u00edm je v\u00fdb\u011br platformy: cloud, nebo on-premises? Cloudov\u00e9 platformy (AWS, Azure, Google Cloud) nab\u00edzej\u00ed spravovan\u00e9 slu\u017eby, \u0161k\u00e1lovatelnost a provozn\u00ed jednoduchost. On-premise \u0159e\u0161en\u00ed nab\u00edzej\u00ed datovou suverenitu a kontrolu n\u00e1klad\u016f pro organizace s masivn\u00edmi objemy dat. V\u011bt\u0161ina organizac\u00ed vol\u00ed cloud, ale n\u011bkter\u00e1 regulovan\u00e1 odv\u011btv\u00ed nebo organizace citliv\u00e9 na data vol\u00ed on-premises.<\/div>\n<div>Druh\u00fdm rozhodnut\u00edm je technologie \u00falo\u017ei\u0161t\u011b. Cloudov\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b (S3, Blob Storage, Cloud Storage) je standardn\u00ed volbou pro nov\u00e9 implementace. On-premise implementace mohou vyu\u017e\u00edvat HDFS (Hadoop Distributed File System) nebo jin\u00e9 distribuovan\u00e9 souborov\u00e9 syst\u00e9my.<\/div>\n<div>T\u0159et\u00edm rozhodnut\u00edm je zpracovatelsk\u00fd framework. Apache Spark je de facto standardem pro d\u00e1vkov\u00e9 zpracov\u00e1n\u00ed. Pro streamov\u00e1n\u00ed se pou\u017e\u00edv\u00e1 Kafka pro ingestaci a Spark Streaming nebo Flink pro zpracov\u00e1n\u00ed. Pro SQL dotazy jsou popul\u00e1rn\u00ed volbou Presto nebo Spark SQL.<\/div>\n<div>\u010ctvrt\u00fdm rozhodnut\u00edm je spr\u00e1va metadaty. Datov\u00e9 katalogy jako Collibra nebo Alation poskytuj\u00ed komplexn\u00ed spr\u00e1vu metadat. Jednodu\u0161\u0161\u00ed implementace mohou vyu\u017e\u00edvat open-source n\u00e1stroje jako Apache Atlas. N\u011bkter\u00e9 organizace buduj\u00ed vlastn\u00ed \u0159e\u0161en\u00ed pro metadata.<\/div>\n<div>N\u00e1vrh architektury by m\u011bl n\u00e1sledovat medailonov\u00fd vzor (bronzov\u00e1\/st\u0159\u00edbrn\u00e1\/zlat\u00e1 z\u00f3na) nebo podobn\u00e9 sch\u00e9ma organizace. To poskytuje jasn\u00e1 o\u010dek\u00e1v\u00e1n\u00ed ohledn\u011b kvality dat a umo\u017e\u0148uje r\u016fzn\u00fdm t\u00fdm\u016fm pracovat na r\u016fzn\u00fdch \u00farovn\u00edch abstrakce.<\/div>\n<h3 data-path-to-node=\"116\">Ingestace dat a integrace<\/h3>\n<div>Jakmile je architektura definov\u00e1na, pozornost se p\u0159esouv\u00e1 k ingestaci. Identifikujte v\u0161echny zdroje dat, kter\u00e9 by m\u011bly nap\u00e1jet data lake. Pro ka\u017ed\u00fd zdroj navrhn\u011bte ingest\u010dn\u00ed kan\u00e1l (pipeline). To m\u016f\u017ee zahrnovat vlastn\u00ed k\u00f3d, spravovan\u00e9 slu\u017eby (AWS Glue, Azure Data Factory) nebo open-source n\u00e1stroje (Apache NiFi, Kafka).<\/div>\n<div>Ingest\u010dn\u00ed kan\u00e1ly by m\u011bly b\u00fdt spolehliv\u00e9 \u2013 ztr\u00e1ta dat je nep\u0159ijateln\u00e1. M\u011bly b\u00fdt idempotentn\u00ed \u2013 opakovan\u00e9 spu\u0161t\u011bn\u00ed kan\u00e1lu produkuje stejn\u00fd v\u00fdsledek. M\u011bly by b\u00fdt pozorovateln\u00e9 \u2013 m\u016f\u017eete monitorovat stav kan\u00e1lu a rychle detekovat selh\u00e1n\u00ed.<\/div>\n<div>Za\u010dn\u011bte se zdroji s vysokou hodnotou, kter\u00e9 \u0159e\u0161\u00ed obchodn\u00ed priority. Nepokou\u0161ejte se ingestovat v\u0161echno okam\u017eit\u011b. Uve\u010fte jako prioritu zdroje, kter\u00e9 jsou dostupn\u00e9, maj\u00ed dobrou kvalitu dat a p\u0159\u00edmo podporuj\u00ed obchodn\u00ed c\u00edle.<\/div>\n<\/div>\n<div>\n<h3 data-path-to-node=\"2\">Governance a spr\u00e1va metadat<\/h3>\n<div>S t\u00edm, jak p\u0159ib\u00fdvaj\u00ed data, se governance st\u00e1v\u00e1 kritickou. Stanovte standardy metadat: jak\u00e1 metadata mus\u00ed b\u00fdt zachycena pro ka\u017edou datovou sadu? Implementujte datov\u00fd katalog, aby tato metadata byla objeviteln\u00e1 a prohled\u00e1vateln\u00e1. Definujte standardy kvality dat: jak\u00fdmi kontrolami kvality mus\u00ed ka\u017ed\u00e1 datov\u00e1 sada proj\u00edt?<\/div>\n<div>Stanovte pravidla pro \u0159\u00edzen\u00ed p\u0159\u00edstupu. Kdo m\u016f\u017ee p\u0159istupovat k jak\u00fdm dat\u016fm? Jak jsou chr\u00e1n\u011bna citliv\u00e1 data (PII, finan\u010dn\u00ed \u00fadaje)? Jak\u00e9 protokolov\u00e1n\u00ed auditu je vy\u017eadov\u00e1no? Implementujte tato pravidla v \u00falo\u017en\u00e9 vrstv\u011b (\u0159\u00edzen\u00ed p\u0159\u00edstupu na \u00farovni objekt\u016f), v dotazovac\u00ed vrstv\u011b (zabezpe\u010den\u00ed na \u00farovni \u0159\u00e1dk\u016f) a prost\u0159ednictv\u00edm monitorov\u00e1n\u00ed (protokolov\u00e1n\u00ed auditu).<\/div>\n<div>Stanovte vlastnictv\u00ed dat. Ka\u017ed\u00e1 datov\u00e1 sada by m\u011bla m\u00edt vlastn\u00edka odpov\u011bdn\u00e9ho za jej\u00ed kvalitu, dokumentaci a governance. Vlastn\u00edci odpov\u00eddaj\u00ed za udr\u017eov\u00e1n\u00ed aktu\u00e1lnosti metadat a \u0159e\u0161en\u00ed probl\u00e9m\u016f s kvalitou.<\/div>\n<h2 data-path-to-node=\"7\">Jak\u00e9 jsou osv\u011bd\u010den\u00e9 postupy pro Data Lake?<\/h2>\n<h3 data-path-to-node=\"8\">Governance a kvalita dat<\/h3>\n<ul data-path-to-node=\"9\">\n<li>\n<div><b data-path-to-node=\"9,0,0\" data-index-in-node=\"0\">Implementujte r\u00e1mec pro governance dat.<\/b> Definujte role a odpov\u011bdnosti: kdo vlastn\u00ed data? Kdo schvaluje nov\u00e9 zdroje dat? Kdo monitoruje kvalitu? Stanovte procesy pro ingestaci dat, zaji\u0161t\u011bn\u00ed kvality a n\u00e1pravu. Zajist\u011bte, aby governance byla viditeln\u00e1 a vym\u00e1han\u00e1, ne pouze deklarativn\u00ed.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"9,1,0\" data-index-in-node=\"0\">Stanovte standardy metadat.<\/b> Definujte po\u017eadovan\u00e1 metadata pro ka\u017edou datovou sadu: zdroj, vlastn\u00edk, datum vytvo\u0159en\u00ed, frekvence aktualizac\u00ed, stav kvality, \u00farove\u0148 citlivosti, obchodn\u00ed popis. Ud\u011blejte z metadat prioritu prvn\u00ed kategorie, nikoli vedlej\u0161\u00ed my\u0161lenku.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"9,2,0\" data-index-in-node=\"0\">Implementujte monitorov\u00e1n\u00ed kvality dat.<\/b> Pr\u016fb\u011b\u017en\u011b monitorujte kvalitu dat. Definujte metriky kvality: \u00faplnost (jsou vypln\u011bna po\u017eadovan\u00e1 pole?), p\u0159esnost (odpov\u00eddaj\u00ed data zdrojov\u00fdm syst\u00e9m\u016fm?), konzistence (jsou hodnoty v o\u010dek\u00e1van\u00e9m rozmez\u00ed?), v\u010dasnost (jsou data aktu\u00e1ln\u00ed?). Upozor\u0148ujte na probl\u00e9my s kvalitou a stanovte procesy n\u00e1pravy.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"9,3,0\" data-index-in-node=\"0\">Dodr\u017eujte medailonovou architekturu.<\/b> Organizujte data do z\u00f3n na z\u00e1klad\u011b zralosti: bronzov\u00e1 (syrov\u00e1), st\u0159\u00edbrn\u00e1 (vy\u010di\u0161t\u011bn\u00e1), zlat\u00e1 (optimalizovan\u00e1). To poskytuje jasn\u00e1 o\u010dek\u00e1v\u00e1n\u00ed stran kvality a umo\u017e\u0148uje r\u016fzn\u00fdm t\u00fdm\u016fm pracovat na r\u016fzn\u00fdch \u00farovn\u00edch abstrakce.<\/div>\n<\/li>\n<\/ul>\n<h3 data-path-to-node=\"11\">Bezpe\u010dnost a \u0159\u00edzen\u00ed p\u0159\u00edstupu<\/h3>\n<ul data-path-to-node=\"12\">\n<li>\n<div><b data-path-to-node=\"12,0,0\" data-index-in-node=\"0\">Implementujte \u0159\u00edzen\u00ed p\u0159\u00edstupu na z\u00e1klad\u011b rol\u00ed (RBAC).<\/b> Definujte role (nap\u0159. datov\u00fd v\u011bdec, analytik, mana\u017eer) a p\u0159ideMacro opr\u00e1vn\u011bn\u00ed rol\u00edm, nikoli jednotlivc\u016fm. To zjednodu\u0161uje spr\u00e1vu a zaji\u0161\u0165uje konzistentn\u00ed p\u0159\u00edstupov\u00e1 pravidla.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"12,1,0\" data-index-in-node=\"0\">\u0160ifrujte data v klidu i p\u0159i p\u0159enosu.<\/b> Pou\u017e\u00edvejte standardn\u00ed \u0161ifrov\u00e1n\u00ed (AES-256 pro \u00falo\u017ei\u0161t\u011b, TLS pro p\u0159enos). Spravujte \u0161ifrovac\u00ed kl\u00ed\u010de bezpe\u010dn\u011b, s rotac\u00ed a \u0159\u00edzen\u00edm p\u0159\u00edstupu.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"12,2,0\" data-index-in-node=\"0\">Implementujte zabezpe\u010den\u00ed na \u00farovni pol\u00ed pro citliv\u00e1 data.<\/b> Pro osobn\u00ed identifika\u010dn\u00ed \u00fadaje (PII) nebo jin\u00e1 citliv\u00e1 pole implementujte maskov\u00e1n\u00ed nebo redakci. Z\u00e1stupce z\u00e1kaznick\u00e9ho servisu m\u016f\u017ee vid\u011bt jm\u00e9na a adresy z\u00e1kazn\u00edk\u016f, ale ne \u010d\u00edsla kreditn\u00edch karet. Datov\u00fd v\u011bdec m\u016f\u017ee vid\u011bt agregovan\u00e9 chov\u00e1n\u00ed z\u00e1kazn\u00edk\u016f, ale ne jednotliv\u00e9 identity.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"12,3,0\" data-index-in-node=\"0\">Udr\u017eujte auditn\u00ed logy.<\/b> Protokolujte ve\u0161ker\u00fd p\u0159\u00edstup k dat\u016fm. Kdo p\u0159istupoval k jak\u00fdm dat\u016fm, kdy a odkud? Auditn\u00ed logy umo\u017e\u0148uj\u00ed audity compliance a forenzn\u00ed vy\u0161et\u0159ov\u00e1n\u00ed bezpe\u010dnostn\u00edch incident\u016f.<\/div>\n<\/li>\n<\/ul>\n<h3 data-path-to-node=\"14\">Optimalizace v\u00fdkonu<\/h3>\n<ul data-path-to-node=\"15\">\n<li>\n<div><b data-path-to-node=\"15,0,0\" data-index-in-node=\"0\">Strategicky vyu\u017e\u00edvejte partitionov\u00e1n\u00ed dat.<\/b> Organizujte data podle data, geografie nebo jin\u00fdch dimenz\u00ed, kter\u00e9 odpov\u00eddaj\u00ed vzorc\u016fm dotazov\u00e1n\u00ed. Partitionov\u00e1n\u00ed umo\u017e\u0148uje dotazovac\u00edm stroj\u016fm p\u0159esko\u010dit nerelevantn\u00ed data, co\u017e dramaticky zlep\u0161uje v\u00fdkon. Dotaz na \u201eprodeje v Q4 2024\u201c m\u016f\u017ee p\u0159esko\u010dit v\u0161echna data z ostatn\u00edch \u010dtvrtlet\u00ed.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"15,1,0\" data-index-in-node=\"0\">Komprmujte data.<\/b> Pou\u017e\u00edvejte kompresn\u00ed form\u00e1ty (Parquet, ORC), kter\u00e9 zmen\u0161uj\u00ed velikost \u00falo\u017ei\u0161t\u011b a zlep\u0161uj\u00ed v\u00fdkon dotaz\u016f. Komprimovan\u00e1 data vy\u017eaduj\u00ed m\u00e9n\u011b \u010dasu na \u010dten\u00ed z \u00falo\u017ei\u0161t\u011b a men\u0161\u00ed \u0161\u00ed\u0159ku p\u00e1sma pro p\u0159enos.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"15,2,0\" data-index-in-node=\"0\">Pou\u017e\u00edvejte vhodn\u00e9 form\u00e1ty soubor\u016f.<\/b> Sloupcov\u00e9 form\u00e1ty (Parquet, ORC) jsou pro analytiku nad\u0159azen\u00e9 \u0159\u00e1dkov\u00fdm form\u00e1t\u016fm (CSV, JSON). Sloupcov\u00e9 form\u00e1ty ukl\u00e1daj\u00ed data po sloupc\u00edch, co\u017e dotaz\u016fm umo\u017e\u0148uje \u010d\u00edst pouze relevantn\u00ed sloupce a p\u0159esko\u010dit ty nerelevantn\u00ed.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"15,3,0\" data-index-in-node=\"0\">Implementujte cachov\u00e1n\u00ed a materializovan\u00e9 pohledy.<\/b> Pro \u010dasto spou\u0161t\u011bn\u00e9 dotazy p\u0159edem vypo\u010d\u00edtejte v\u00fdsledky a ulo\u017ete je do mezipam\u011bti (cache). To poskytuje okam\u017eit\u00e9 v\u00fdsledky bez opakovan\u00e9ho zpracov\u00e1n\u00ed syrov\u00fdch dat.<\/div>\n<\/li>\n<\/ul>\n<h3 data-path-to-node=\"17\">Organiza\u010dn\u00ed a procesn\u00ed osv\u011bd\u010den\u00e9 postupy<\/h3>\n<ul data-path-to-node=\"18\">\n<li>\n<div><b data-path-to-node=\"18,0,0\" data-index-in-node=\"0\">Budujte mezioborov\u00e9 t\u00fdmy.<\/b> \u00dasp\u011bch data lake vy\u017eaduje spolupr\u00e1ci mezi datov\u00fdmi in\u017een\u00fdry (buduj\u00edc\u00edmi kan\u00e1ly), datov\u00fdmi v\u011bdci (vyu\u017e\u00edvaj\u00edc\u00edmi data pro anal\u00fdzy), obchodn\u00edmi analytiky (definuj\u00edc\u00edmi po\u017eadavky) a provozem IT (spravuj\u00edc\u00edm infrastrukturu). T\u00fdmy by m\u011bly m\u00edt jasn\u00e9 role, ale pracovat spolupracuj\u00edc\u00edm zp\u016fsobem.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"18,1,0\" data-index-in-node=\"0\">Investujte do dokumentace a sd\u00edlen\u00ed znalost\u00ed.<\/b> Dokumentujte zdroje dat, datov\u00e9 kan\u00e1ly a anal\u00fdzy. Sd\u00edlejte znalosti nap\u0159\u00ed\u010d t\u00fdmy prost\u0159ednictv\u00edm wiki, \u0161kolen\u00ed a reviz\u00ed k\u00f3du (code reviews). Institucion\u00e1ln\u00ed znalosti by nem\u011bly z\u016fst\u00e1vat u jednotlivc\u016f.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"18,2,0\" data-index-in-node=\"0\">Stanovte SLA a monitorov\u00e1n\u00ed.<\/b> Definujte dohody o \u00farovni slu\u017eeb (SLA): jak\u00e1 je o\u010dek\u00e1van\u00e1 \u010derstvost dat? Jak\u00fd je o\u010dek\u00e1van\u00fd v\u00fdkon dotaz\u016f? Monitorujte pln\u011bn\u00ed t\u011bchto SLA a upozor\u0148ujte na jejich poru\u0161en\u00ed.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"18,3,0\" data-index-in-node=\"0\">Iterujte a neust\u00e1le se zlep\u0161ujte.<\/b> Implementace data lake nen\u00ed nikdy \u201ehotov\u00e1\u201c. Pr\u016fb\u011b\u017en\u011b vyhodnocujte, co funguje, co ne a co by se m\u011blo zm\u011bnit. Pravideln\u00e9 retrospektivy s t\u00fdmy pom\u00e1haj\u00ed identifikovat vylep\u0161en\u00ed.<\/div>\n<\/li>\n<\/ul>\n<h2 data-path-to-node=\"20\">Co je to Lakehouse a jak posouv\u00e1 koncept Data Lake?<\/h2>\n<h3 data-path-to-node=\"21\">Vysv\u011btlen\u00ed architektury Lakehouse<\/h3>\n<div>S t\u00edm, jak data lakes dosp\u00edvala, se objevila nov\u00e1 architektura, kter\u00e1 se sna\u017e\u00ed zkombinovat to nejlep\u0161\u00ed z data lakes a datov\u00fdch sklad\u016f: <b data-path-to-node=\"22\" data-index-in-node=\"135\">lakehouse<\/b>. Lakehouse vyu\u017e\u00edv\u00e1 \u00falo\u017ei\u0161t\u011b data lake (levn\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b), ale p\u0159id\u00e1v\u00e1 s\u00e9mantiku datov\u00e9ho skladu (ACID transakce, vynucov\u00e1n\u00ed sch\u00e9matu, optimalizace SQL).<\/div>\n<div>Kl\u00ed\u010dovou inovac\u00ed umo\u017e\u0148uj\u00edc\u00ed lakehouse je zaveden\u00ed vrstev metadat, kter\u00e9 poskytuj\u00ed strukturu bez nutnosti p\u0159edb\u011b\u017en\u00e9ho n\u00e1vrhu sch\u00e9matu. Technologie jako Delta Lake (od Databricks), Apache Iceberg (od Netflixu) a Apache Hudi (od Uberu) p\u0159id\u00e1vaj\u00ed vrstvu metadat nad objektov\u00e9 \u00falo\u017ei\u0161t\u011b. Tato vrstva metadat sleduje, kter\u00e9 soubory pat\u0159\u00ed ke kter\u00e9 datov\u00e9 sad\u011b, vynucuje sch\u00e9ma, spravuje transakce a umo\u017e\u0148uje cestov\u00e1n\u00ed v \u010dase (time-travel \u2014 dotazov\u00e1n\u00ed na data tak, jak existovala v minulosti).<\/div>\n<div>S t\u011bmito technologiemi z\u00edsk\u00e1v\u00e1te to nejlep\u0161\u00ed z obou sv\u011bt\u016f. M\u016f\u017eete levn\u011b ukl\u00e1dat petabajty dat v objektov\u00e9m \u00falo\u017ei\u0161ti. Data m\u016f\u017eete ingestovat rychle bez p\u0159edb\u011b\u017en\u00e9ho n\u00e1vrhu sch\u00e9matu. Jakmile jsou v\u0161ak data v lakehouse, m\u00e1te z\u00e1ruky ACID transakc\u00ed, vynucov\u00e1n\u00ed sch\u00e9matu a optimalizaci v\u00fdkonu podobn\u011b jako u datov\u00e9ho skladu.<\/div>\n<h3 data-path-to-node=\"26\">Lakehouse vs. tradi\u010dn\u00ed Data Lakes<\/h3>\n<div>Tradi\u010dn\u00ed data lake vynik\u00e1 v ingestaci r\u016fzn\u00fdch typ\u016f dat a podpo\u0159e pr\u016fzkumn\u00e9 anal\u00fdzy. Lakehouse p\u0159id\u00e1v\u00e1 nad tento z\u00e1klad strukturu a v\u00fdkon.<\/div>\n<ul data-path-to-node=\"28\">\n<li>\n<div><b data-path-to-node=\"28,0,0\" data-index-in-node=\"0\">Zlep\u0161en\u00ed v\u00fdkonu:<\/b> Lakehouse vyu\u017e\u00edv\u00e1 statistiky a metadata k optimalizaci dotaz\u016f. Dotazovac\u00ed stroj m\u016f\u017ee p\u0159esko\u010dit soubory, kter\u00e9 neodpov\u00eddaj\u00ed podm\u00ednce dotazu, co\u017e dramaticky zlep\u0161uje v\u00fdkon. Dotazy, kter\u00e9 by v data lake trvaly minuty, mohou v lakehouse trvat sekundy.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"28,1,0\" data-index-in-node=\"0\">Vylep\u0161en\u00ed governance:<\/b> Lakehouse vynucuje sch\u00e9ma, co\u017e umo\u017e\u0148uje lep\u0161\u00ed ov\u011b\u0159ov\u00e1n\u00ed kvality dat. Podporuje ACID transakce, \u010d\u00edm\u017e zaji\u0161\u0165uje konzistenci dat i p\u0159i soub\u011b\u017en\u00e9m z\u00e1pisu. Umo\u017e\u0148uje cestov\u00e1n\u00ed v \u010dase, co\u017e v\u00e1m dovoluje dotazovat se na data v podob\u011b, v jak\u00e9 existovala v minulosti.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"28,2,0\" data-index-in-node=\"0\">Sjednocen\u00e1 analytika:<\/b> Lakehouse podporuje v\u0161echny p\u0159\u00edpady pou\u017eit\u00ed analytiky \u2013 \u0159\u00eddic\u00ed panely v re\u00e1ln\u00e9m \u010dase, d\u00e1vkov\u00e9 strojov\u00e9 u\u010den\u00ed, pr\u016fzkumnou anal\u00fdzu \u2013 v r\u00e1mci jedin\u00e9 platformy. Nepot\u0159ebujete odd\u011blen\u00fd datov\u00fd sklad a data lake; lakehouse zvl\u00e1d\u00e1 oboj\u00ed.<\/div>\n<\/li>\n<\/ul>\n<h3 data-path-to-node=\"30\">N\u00e1stroje a platformy podporuj\u00edc\u00ed Lakehouse<\/h3>\n<ul data-path-to-node=\"31\">\n<li>\n<div><b data-path-to-node=\"31,0,0\" data-index-in-node=\"0\">Delta Lake<\/b> (od Databricks) p\u0159id\u00e1v\u00e1 k objektov\u00e9mu \u00falo\u017ei\u0161ti ACID transakce, vynucov\u00e1n\u00ed sch\u00e9matu a cestov\u00e1n\u00ed v \u010dase. Je postaven na form\u00e1tu Parquet a integruje se s Apache Spark. Delta Lake je open-source a \u0161iroce p\u0159ij\u00edman\u00fd.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"31,1,0\" data-index-in-node=\"0\">Apache Iceberg<\/b> (od Netflixu) poskytuje podobnou funkcionalitu s odli\u0161n\u00fdm architektonick\u00fdm p\u0159\u00edstupem. Iceberg klade d\u016fraz na skryt\u00e9 partitionov\u00e1n\u00ed a v\u00fdvoj partition, co\u017e umo\u017e\u0148uje efektivn\u00ed dotazy i p\u0159i v\u00fdvoji dat.<\/div>\n<\/li>\n<li>\n<div><b data-path-to-node=\"31,2,0\" data-index-in-node=\"0\">Apache Hudi<\/b> (od Uberu) se zam\u011b\u0159uje na inkrement\u00e1ln\u00ed zpracov\u00e1n\u00ed, co\u017e umo\u017e\u0148uje efektivn\u00ed aktualizace a maz\u00e1n\u00ed ve velk\u00fdch datov\u00fdch sad\u00e1ch.<\/div>\n<\/li>\n<\/ul>\n<div>Cloudov\u00ed dodavatel\u00e9 tak\u00e9 zabudov\u00e1vaj\u00ed funkcionalitu lakehouse do sv\u00fdch platforem. Databricks (zalo\u017een\u00fd tv\u016frci Sparku a Delta Lake) nab\u00edz\u00ed spravovanou platformu lakehouse. Snowflake zavedl podporu Iceberg. AWS vydal podporu Apache Iceberg v n\u00e1stroji Athena. Microsoft integruje koncepty lakehouse do slu\u017eby Fabric.<\/div>\n<h2 data-path-to-node=\"34\">Jak Data Lake podporuje digit\u00e1ln\u00ed transformaci?<\/h2>\n<h3 data-path-to-node=\"35\">Umo\u017en\u011bn\u00ed rozhodov\u00e1n\u00ed zalo\u017een\u00e9ho na datech<\/h3>\n<div>Digit\u00e1ln\u00ed transformace je ve sv\u00e9 podstat\u011b o vyu\u017e\u00edv\u00e1n\u00ed dat a technologi\u00ed k zlep\u0161en\u00ed obchodn\u00edch v\u00fdsledk\u016f. Data lake je pro tuto transformaci z\u00e1kladem, proto\u017ee demokratizuje p\u0159\u00edstup k dat\u016fm.<\/div>\n<div>V organizac\u00edch p\u0159ed \u00e9rou data lake byla data uzam\u010dena v provozn\u00edch syst\u00e9mech. Obchodn\u00ed u\u017eivatel, kter\u00fd cht\u011bl odpov\u011bd\u011bt na ot\u00e1zku, musel po\u017e\u00e1dat IT o report. IT napsalo dotaz, spustilo jej a vr\u00e1tilo v\u00fdsledky \u2013 proces trvaj\u00edc\u00ed dny nebo t\u00fddny. V organizaci s data lake mohou obchodn\u00ed u\u017eivatel\u00e9 p\u0159istupovat k dat\u016fm p\u0159\u00edmo prost\u0159ednictv\u00edm samoobslu\u017en\u00fdch analytick\u00fdch n\u00e1stroj\u016f. Mohou prozkoum\u00e1vat data, testovat hypot\u00e9zy a generovat poznatky v re\u00e1ln\u00e9m \u010dase. Toto zrychlen\u00ed cyklu od poznatku k akci m\u00e1 transforma\u010dn\u00ed charakter.<\/div>\n<div>Data lakes tak\u00e9 umo\u017e\u0148uj\u00ed pokro\u010dilej\u0161\u00ed analytiku. M\u00edsto jednoduch\u00fdch report\u016f (prodeje podle region\u016f, z\u00e1kazn\u00edci podle segment\u016f) mohou organizace prov\u00e1d\u011bt prediktivn\u00ed analytiku (kte\u0159\u00ed z\u00e1kazn\u00edci pravd\u011bpodobn\u011b odejdou?), preskriptivn\u00ed analytiku (jak\u00e9 kroky maximalizuj\u00ed ziskovost?) a kauz\u00e1ln\u00ed anal\u00fdzu (co zp\u016fsobilo tento v\u00fdsledek?). Tyto pokro\u010dil\u00e9 analytick\u00e9 metody vy\u017eaduj\u00ed p\u0159\u00edstup k syrov\u00fdm, granul\u00e1rn\u00edm dat\u016fm \u2013 p\u0159esn\u011b to, co data lake poskytuje.<\/div>\n<h3 data-path-to-node=\"40\">Podpora iniciativ AI a strojov\u00e9ho u\u010den\u00ed<\/h3>\n<div>AI a strojov\u00e9 u\u010den\u00ed jsou \u00fast\u0159edn\u00edm bodem digit\u00e1ln\u00ed transformace. Organizace cht\u011bj\u00ed automatizovat rozhodnut\u00ed, personalizovat z\u00e1\u017eitky, optimalizovat provoz a objevovat nov\u00e9 poznatky prost\u0159ednictv\u00edm strojov\u00e9ho u\u010den\u00ed.<\/div>\n<div>Data lake je nezbytnou infrastrukturou pro iniciativy AI\/ML. Modely strojov\u00e9ho u\u010den\u00ed vy\u017eaduj\u00ed velk\u00e9 objemy tr\u00e9novac\u00edch dat. \u010c\u00edm v\u00edce dat, t\u00edm lep\u0161\u00ed model (v ur\u010dit\u00fdch mez\u00edch). Data lake poskytuje tato data v pot\u0159ebn\u00e9m m\u011b\u0159\u00edtku a cen\u011b. Modely nav\u00edc vy\u017eaduj\u00ed r\u016fznorod\u00e9 typy dat \u2013 strukturovan\u00e1 data, obr\u00e1zky, text, ode\u010dty ze sn\u00edma\u010d\u016f. Data lake pojme v\u0161echna tato data.<\/div>\n<div>Data lakes tak\u00e9 zrychluj\u00ed experiment\u00e1ln\u00ed cyklus. Datov\u00fd v\u011bdec m\u016f\u017ee p\u0159istupovat k syrov\u00fdm dat\u016fm, prov\u00e1d\u011bt in\u017een\u00fdrstv\u00ed funkc\u00ed, tr\u00e9novat modely a vyhodnocovat v\u00fdsledky b\u011bhem hodin. Tato rychl\u00e1 iterace vede k lep\u0161\u00edm model\u016fm a rychlej\u0161\u00edmu dosa\u017een\u00ed hodnoty.<\/div>\n<div>Jakmile jsou modely nasazeny, data lake poskytuje infrastrukturu pro neust\u00e1l\u00e9 zlep\u0161ov\u00e1n\u00ed. S p\u0159\u00edchodem nov\u00fdch dat lze modely p\u0159etr\u00e9novat na aktualizovan\u00fdch datech, co\u017e zaji\u0161\u0165uje jejich p\u0159esnost i v m\u011bn\u00edc\u00edm se sv\u011bt\u011b.<\/div>\n<div>Organizace implementuj\u00edc\u00ed data lakes \u010dasto vyu\u017e\u00edvaj\u00ed odborn\u00e9 veden\u00ed v oblasti architektury a strategie governance. T\u00fdm pro datov\u00e9 schopnosti spole\u010dnosti Greyson v\u00e1m m\u016f\u017ee pomoci navrhnout a implementovat data lake, kter\u00e9 bude v souladu s va\u0161imi obchodn\u00edmi c\u00edli, podpo\u0159\u00ed va\u0161e analytick\u00e9 a AI iniciativy a poskytne governance a bezpe\u010dnost, kter\u00e9 va\u0161e organizace vy\u017eaduje.<\/div>\n<h2 data-path-to-node=\"47\">B\u011b\u017en\u00e9 m\u00fdty o Data Lakes<\/h2>\n<h3 data-path-to-node=\"48\">\u201eData Lake je jen skl\u00e1dka pro v\u0161echna data\u201c<\/h3>\n<div>To je mo\u017en\u00e1 nejschopn\u011bj\u0161\u00ed m\u00fdtus. Data lake bez governance je skute\u010dn\u011b \u201edatovou ba\u017einou\u201c \u2013 data existuj\u00ed, ale jsou nepou\u017eiteln\u00e1. Dob\u0159e spravovan\u00e9 data lake je v\u0161ak vysoce organizovan\u00e9 a hodnotn\u00e9.<\/div>\n<div>Governance nen\u00ed voliteln\u00e1. Je z\u00e1kladn\u00ed. Pot\u0159ebujete spr\u00e1vu metadat, monitorov\u00e1n\u00ed kvality dat, \u0159\u00edzen\u00ed p\u0159\u00edstupu a jasn\u00e9 vlastnictv\u00ed. Tyto prvky prom\u011b\u0148uj\u00ed skl\u00e1dku dat ve hodnotn\u00e9 aktivum. Organizace, kter\u00e9 p\u0159istupuj\u00ed ke governance jako k priorit\u011b prvn\u00ed kategorie od samotn\u00e9ho po\u010d\u00e1tku, se pasti datov\u00e9 ba\u017einy vyhnou.<\/div>\n<h3 data-path-to-node=\"52\">\u201eData Lakes nahrazuj\u00ed datov\u00e9 sklady\u201c<\/h3>\n<div>To je nespr\u00e1vn\u00e9. Data lakes a datov\u00e9 sklady slou\u017e\u00ed r\u016fzn\u00fdm \u00fa\u010del\u016fm a navz\u00e1jem se dopl\u0148uj\u00ed. Data lake je ide\u00e1ln\u00ed pro pr\u016fzkum a strojov\u00e9 u\u010den\u00ed. Datov\u00fd sklad je ide\u00e1ln\u00ed pro podnikov\u00fd reporting a BI. V\u011bt\u0161ina \u00fasp\u011b\u0161n\u00fdch organizac\u00ed pou\u017e\u00edv\u00e1 oboj\u00ed.<\/div>\n<div>Modern\u00ed analytick\u00e1 architektura m\u00e1 ve skute\u010dnosti \u010dasto data proud\u00edc\u00ed z data lake do datov\u00e9ho skladu. Syrov\u00e1 data p\u0159istanou v data lake. Zpracovatelsk\u00e9 kan\u00e1ly je transformuj\u00ed. Rafinovan\u00e1 data proud\u00ed do datov\u00e9ho skladu. N\u00e1stroje BI konzumuj\u00ed data ze skladu. Data lake a datov\u00fd sklad pracuj\u00ed spole\u010dn\u011b jako sou\u010d\u00e1st integrovan\u00e9 analytick\u00e9 platformy.<\/div>\n<h3 data-path-to-node=\"56\">\u201eBudov\u00e1n\u00ed Data Lake je \u010dist\u011b technick\u00e1 v\u00fdzva\u201c<\/h3>\n<div>To je ne\u00fapln\u00fd pohled. Ano, na technick\u00fdch rozhodnut\u00edch z\u00e1le\u017e\u00ed \u2013 v\u00fdb\u011br platformy, v\u00fdb\u011br n\u00e1stroj\u016f, n\u00e1vrh architektury. Organiza\u010dn\u00ed faktory a faktory governance jsou v\u0161ak stejn\u011b d\u016fle\u017eit\u00e9.<\/div>\n<div>\u00dasp\u011b\u0161n\u00e9 implementace data lake vy\u017eaduj\u00ed jasn\u00e9 obchodn\u00ed c\u00edle, mezioborov\u00e9 t\u00fdmy, silnou governance a \u0159\u00edzen\u00ed organiza\u010dn\u00ed zm\u011bny. Technick\u00e1 dokonalost bez organiza\u010dn\u00ed shody vede k selh\u00e1n\u00ed. Perfektn\u011b navr\u017een\u00e9 data lake, kter\u00e9 nikdo nepou\u017e\u00edv\u00e1, nen\u00ed \u00fasp\u011b\u0161n\u00e9. Naopak technicky m\u00e9n\u011b slo\u017eit\u00e9 data lake se silnou obchodn\u00ed podporou a governance m\u00e1 vy\u0161\u0161\u00ed pravd\u011bpodobnost \u00fasp\u011bchu.<\/div>\n<h2 data-path-to-node=\"60\">\u010casto kladen\u00e9 ot\u00e1zky (FAQ)<\/h2>\n<h3 data-path-to-node=\"61\">Co je to data lake?<\/h3>\n<div>Data lake je centralizovan\u00e9 \u00falo\u017ei\u0161t\u011b, kter\u00e9 uchov\u00e1v\u00e1 velk\u00e9 objemy strukturovan\u00fdch, polostrukturovan\u00fdch a nestrukturovan\u00fdch dat v jejich rodn\u00e9m, syrov\u00e9m form\u00e1tu. Na rozd\u00edl od datov\u00fdch sklad\u016f, kter\u00e9 vynucuj\u00ed sch\u00e9ma p\u0159ed ulo\u017een\u00edm dat, vyu\u017e\u00edvaj\u00ed data lakes p\u0159\u00edstup schema-on-read, co\u017e umo\u017e\u0148uje ukl\u00e1dat data v jejich p\u016fvodn\u00ed podob\u011b a strukturovat je a\u017e p\u0159i anal\u00fdze. Data lakes vyu\u017e\u00edvaj\u00ed levn\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b (jako AWS S3) a plochou architekturu, co\u017e umo\u017e\u0148uje masivn\u00ed \u0161k\u00e1lovatelnost a n\u00e1kladovou efektivitu.<\/div>\n<h3 data-path-to-node=\"63\">Jak se data lake li\u0161\u00ed od datov\u00e9ho skladu?<\/h3>\n<div>Kl\u00ed\u010dov\u00e9 rozd\u00edly jsou: (1) P\u0159\u00edstup ke sch\u00e9matu \u2013 data lakes pou\u017e\u00edvaj\u00ed schema-on-read, sklady schema-on-write; (2) Form\u00e1t dat \u2013 data lakes ukl\u00e1daj\u00ed syrov\u00e1 data, sklady zpracovan\u00e1 data; (3) Flexibilita \u2013 data lakes pojmou jak\u00fdkoli typ dat, sklady jsou optimalizov\u00e1ny pro strukturovan\u00e1 data; (4) P\u0159\u00edpady pou\u017eit\u00ed \u2013 data lakes vynikaj\u00ed v pr\u016fzkumu a ML, sklady v BI a reportingu; (5) N\u00e1klady \u2013 data lakes jsou levn\u011bj\u0161\u00ed pro ukl\u00e1d\u00e1n\u00ed syrov\u00fdch dat, sklady jsou optimalizov\u00e1ny pro v\u00fdkon dotaz\u016f. Oboj\u00ed m\u00e1 svou hodnotu; v\u011bt\u0161ina organizac\u00ed pou\u017e\u00edv\u00e1 oboj\u00ed.<\/div>\n<h3 data-path-to-node=\"65\">Jak\u00e9 jsou v\u00fdhody data lake?<\/h3>\n<div>Kl\u00ed\u010dov\u00e9 v\u00fdhody zahrnuj\u00ed: (1) N\u00e1kladovou efektivitu \u2013 levn\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b umo\u017e\u0148uje ukl\u00e1dat masivn\u00ed objemy dat; (2) Flexibilitu \u2013 ukl\u00e1d\u00e1n\u00ed jak\u00e9hokoli typu dat bez p\u0159eddefinovan\u00e9ho sch\u00e9matu; (3) Podporu strojov\u00e9ho u\u010den\u00ed \u2013 syrov\u00e1 data s plnou v\u011brnost\u00ed umo\u017e\u0148uj\u00ed lep\u0161\u00ed modely ML; (4) Analytiku v re\u00e1ln\u00e9m \u010dase \u2013 podpora streamovan\u00fdch dat umo\u017e\u0148uje okam\u017eit\u00e9 poznatky; (5) \u0160k\u00e1lovatelnost \u2013 cloudov\u00e1 data lakes \u0161k\u00e1luj\u00ed na petabajty bez poklesu v\u00fdkonu; (6) Demokratizovan\u00fd p\u0159\u00edstup \u2013 samoobslu\u017en\u00e9 analytick\u00e9 n\u00e1stroje umo\u017e\u0148uj\u00ed obchodn\u00edm u\u017eivatel\u016fm p\u0159istupovat k dat\u016fm p\u0159\u00edmo.<\/div>\n<h3 data-path-to-node=\"67\">Jak\u00e9 v\u00fdzvy prov\u00e1zej\u00ed implementaci data lake?<\/h3>\n<div>Mezi hlavn\u00ed v\u00fdzvy pat\u0159\u00ed: (1) Governance \u2013 bez governance se data lakes m\u011bn\u00ed v datov\u00e9 ba\u017einy; (2) Spr\u00e1va metadat \u2013 sledov\u00e1n\u00ed toho, jak\u00e1 data existuj\u00ed a odkud poch\u00e1zej\u00ed, je ve velk\u00e9m m\u011b\u0159\u00edtku slo\u017eit\u00e9; (3) Bezpe\u010dnost \u2013 ochrana citliv\u00fdch dat p\u0159i sou\u010dasn\u00e9m umo\u017en\u011bn\u00ed p\u0159\u00edstupu je obt\u00ed\u017en\u00e1; (4) Po\u017eadavky na dovednosti \u2013 budov\u00e1n\u00ed a provoz data lakes vy\u017eaduje specializovan\u00e9 odborn\u00e9 znalosti; (5) Spr\u00e1va n\u00e1klad\u016f \u2013 a\u010dkoli je \u00falo\u017ei\u0161t\u011b levn\u00e9, v\u00fdpo\u010detn\u00ed n\u00e1klady mohou b\u00fdt zna\u010dn\u00e9; (6) V\u00fdkon \u2013 dotazy nad syrov\u00fdmi daty mohou b\u00fdt bez optimalizace pomal\u00e9; (7) Slo\u017eitost \u2013 integrace r\u016fzn\u00fdch n\u00e1stroj\u016f a spr\u00e1va v\u00edce syst\u00e9m\u016f je n\u00e1ro\u010dn\u00e1.<\/div>\n<h3 data-path-to-node=\"69\">Jak vybudovat data lake?<\/h3>\n<div>Proces zahrnuje: (1) Strategick\u00e9 pl\u00e1nov\u00e1n\u00ed \u2013 definov\u00e1n\u00ed obchodn\u00edch c\u00edl\u016f a posouzen\u00ed sou\u010dasn\u00e9ho datov\u00e9ho prost\u0159ed\u00ed; (2) N\u00e1vrh architektury \u2013 v\u00fdb\u011br platformy (cloud\/on-premises), technologie \u00falo\u017ei\u0161t\u011b, zpracovatelsk\u00fdch framework\u016f a n\u00e1stroj\u016f governance; (3) Pilotn\u00ed projekt \u2013 za\u010d\u00e1tek s zam\u011b\u0159en\u00fdm projektem \u0159e\u0161\u00edc\u00edm konkr\u00e9tn\u00ed obchodn\u00ed probl\u00e9m; (4) Ingestace dat \u2013 n\u00e1vrh kan\u00e1l\u016f pro ingestaci dat ze zdrojov\u00fdch syst\u00e9m\u016f; (5) Implementace governance \u2013 stanoven\u00ed standard\u016f metadat, monitorov\u00e1n\u00ed kvality dat a \u0159\u00edzen\u00ed p\u0159\u00edstupu; (6) Iterace \u2013 neust\u00e1l\u00e9 zlep\u0161ov\u00e1n\u00ed na z\u00e1klad\u011b zku\u0161enost\u00ed a zp\u011btn\u00e9 vazby.<\/div>\n<h3 data-path-to-node=\"71\">Co je to architektura data lake?<\/h3>\n<div>Architektura data lake zahrnuje: (1) Ingest\u010dn\u00ed vrstvu \u2013 p\u0159iv\u00e1d\u00ed data ze zdroj\u016f do lake; (2) \u00dalo\u017enou vrstvu \u2013 objektov\u00e9 \u00falo\u017ei\u0161t\u011b uchov\u00e1vaj\u00edc\u00ed syrov\u00e1 data; (3) Zpracovatelskou vrstvu \u2013 transformuje a obohacuje data; (4) Analytickou vrstvu \u2013 n\u00e1stroje pro dotazov\u00e1n\u00ed a anal\u00fdzu dat; (5) Vrstvu governance \u2013 metadata, kvalita a \u0159\u00edzen\u00ed p\u0159\u00edstupu. Medailonov\u00e1 architektura organizuje data do bronzov\u00e9 (syrov\u00e1), st\u0159\u00edbrn\u00e9 (vy\u010di\u0161t\u011bn\u00e1) a zlat\u00e9 (optimalizovan\u00e1) z\u00f3ny na z\u00e1klad\u011b zralosti.<\/div>\n<h3 data-path-to-node=\"73\">Jak\u00e9 jsou osv\u011bd\u010den\u00e9 postupy pro data lake?<\/h3>\n<div>Kl\u00ed\u010dov\u00e9 postupy zahrnuj\u00ed: (1) Implementaci r\u00e1mce governance \u2013 stanoven\u00ed rol\u00ed, odpov\u011bdnost\u00ed a proces\u016f; (2) Dodr\u017eov\u00e1n\u00ed medailonov\u00e9 architektury \u2013 organizace dat podle \u00farovn\u011b zralosti; (3) Spr\u00e1vu metadat \u2013 zachycov\u00e1n\u00ed a udr\u017eov\u00e1n\u00ed komplexn\u00edch metadat; (4) Monitorov\u00e1n\u00ed kvality dat \u2013 pr\u016fb\u011b\u017en\u00e9 ov\u011b\u0159ov\u00e1n\u00ed dat v\u016f\u010di standard\u016fm kvality; (5) Zabezpe\u010den\u00ed citliv\u00fdch dat \u2013 \u0161ifrov\u00e1n\u00ed, implementace \u0159\u00edzen\u00ed p\u0159\u00edstupu, udr\u017eov\u00e1n\u00ed auditn\u00edch log\u016f; (6) Optimalizaci v\u00fdkonu \u2013 vyu\u017eit\u00ed partitionov\u00e1n\u00ed, komprese a vhodn\u00fdch form\u00e1t\u016f soubor\u016f; (7) Stanoven\u00ed SLA \u2013 definov\u00e1n\u00ed a monitorov\u00e1n\u00ed \u00farovn\u00ed slu\u017eeb; (8) Budov\u00e1n\u00ed mezioborov\u00fdch t\u00fdm\u016f \u2013 spolupr\u00e1ce nap\u0159\u00ed\u010d datov\u00fdm in\u017een\u00fdrstv\u00edm, datovou v\u011bdou a obchodn\u00edmi t\u00fdmy.<\/div>\n<h3 data-path-to-node=\"75\">Jak data lake podporuje strojov\u00e9 u\u010den\u00ed?<\/h3>\n<div>Data lakes podporuj\u00ed ML t\u00edm, \u017ee: (1) Poskytuj\u00ed syrov\u00e1 data \u2013 modely ML vy\u017eaduj\u00ed pro tr\u00e9nov\u00e1n\u00ed syrov\u00e1, nezpracovan\u00e1 data s plnou v\u011brnost\u00ed; (2) Umo\u017e\u0148uj\u00ed experimentov\u00e1n\u00ed \u2013 datov\u00ed v\u011bdci mohou rychle p\u0159istupovat k dat\u016fm a testovat r\u016fzn\u00e9 p\u0159\u00edstupy k in\u017een\u00fdrstv\u00ed funkc\u00ed; (3) Podporuj\u00ed r\u016fznorod\u00e9 typy dat \u2013 data lakes ukl\u00e1daj\u00ed obr\u00e1zky, text, data ze sn\u00edma\u010d\u016f a dal\u0161\u00ed nestrukturovan\u00e1 data, kter\u00e1 modern\u00ed modely ML vy\u017eaduj\u00ed; (4) \u0160k\u00e1luj\u00ed na velk\u00e9 datov\u00e9 sady \u2013 cloudov\u00e1 data lakes mohou ukl\u00e1dat masivn\u00ed datov\u00e9 sady pot\u0159ebn\u00e9 pro tr\u00e9nov\u00e1n\u00ed model\u016f hlubok\u00e9ho u\u010den\u00ed; (5) Umo\u017e\u0148uj\u00ed neust\u00e1l\u00e9 zlep\u0161ov\u00e1n\u00ed \u2013 s p\u0159\u00edchodem nov\u00fdch dat lze modely p\u0159etr\u00e9novat pro udr\u017een\u00ed p\u0159esnosti.<\/div>\n<h3 data-path-to-node=\"77\">Co je to lakehouse a jak souvis\u00ed s data lakes?<\/h3>\n<div>Lakehouse kombinuje \u00falo\u017ei\u0161t\u011b data lake (levn\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b) se s\u00e9mantikou datov\u00e9ho skladu (ACID transakce, vynucov\u00e1n\u00ed sch\u00e9matu, optimalizace SQL). Technologie jako Delta Lake p\u0159id\u00e1vaj\u00ed vrstvu metadat nad objektov\u00e9 \u00falo\u017ei\u0161t\u011b, co\u017e umo\u017e\u0148uje z\u00e1ruky struktury a v\u00fdkonu p\u0159i zachov\u00e1n\u00ed flexibility a n\u00e1kladov\u00e9 efektivity data lakes. Lakehouses p\u0159edstavuj\u00ed v\u00fdvoj, kter\u00fd se sna\u017e\u00ed poskytnout to nejlep\u0161\u00ed z data lakes i datov\u00fdch sklad\u016f v jedin\u00e9 platform\u011b.<\/div>\n<h3 data-path-to-node=\"79\">Jak\u00e9 jsou kl\u00ed\u010dov\u00e9 komponenty data lake?<\/h3>\n<div>Kl\u00ed\u010dov\u00e9 komponenty zahrnuj\u00ed: (1) \u00dalo\u017ei\u0161t\u011b \u2013 cloudov\u00e9 objektov\u00e9 \u00falo\u017ei\u0161t\u011b (S3, Blob Storage) nebo distribuovan\u00e9 souborov\u00e9 syst\u00e9my; (2) Ingest\u010dn\u00ed n\u00e1stroje \u2013 Kafka pro streamov\u00e1n\u00ed, Glue\/NiFi pro d\u00e1vky; (3) Zpracovatelsk\u00e9 frameworky \u2013 Spark pro d\u00e1vky, Flink pro streamov\u00e1n\u00ed; (4) Dotazovac\u00ed stroje \u2013 Presto, Spark SQL nebo cloudov\u011b nativn\u00ed mo\u017enosti; (5) Datov\u00fd katalog \u2013 spr\u00e1va metadat a objevov\u00e1n\u00ed; (6) Orchestrace \u2013 n\u00e1stroje jako Airflow pro pl\u00e1nov\u00e1n\u00ed a monitorov\u00e1n\u00ed kan\u00e1l\u016f; (7) Bezpe\u010dnost \u2013 \u0161ifrov\u00e1n\u00ed, \u0159\u00edzen\u00ed p\u0159\u00edstupu, protokolov\u00e1n\u00ed auditu; (8) Monitorov\u00e1n\u00ed \u2013 monitorov\u00e1n\u00ed kvality dat, v\u00fdkonu a n\u00e1klad\u016f.<\/div>\n<h3 data-path-to-node=\"81\">Jak\u00fd je rozd\u00edl mezi ETL a ELT v data lakes?<\/h3>\n<div>ETL (Extract, Transform, Load) transformuje data p\u0159ed nahr\u00e1n\u00edm do skladu \u2013 tradi\u010dn\u00ed p\u0159\u00edstup. ELT (Extract, Load, Transform) nejprve nahraje syrov\u00e1 data a a\u017e pot\u00e9 je transformuje \u2013 p\u0159\u00edstup data lake. ELT je flexibiln\u011bj\u0161\u00ed (r\u016fzn\u00e9 transformace pro r\u016fzn\u00e9 p\u0159\u00edpady pou\u017eit\u00ed) a rychlej\u0161\u00ed (\u017e\u00e1dn\u00e1 p\u0159edb\u011b\u017en\u00e1 transformace), ale p\u0159en\u00e1\u0161\u00ed v\u011bt\u0161\u00ed z\u00e1t\u011b\u017e na u\u017eivatele ohledn\u011b pochopen\u00ed syrov\u00fdch dat. V\u011bt\u0161ina data lakes pou\u017e\u00edv\u00e1 ELT pro ingestaci syrov\u00fdch dat, s n\u00e1sledn\u00fdmi transformacemi pro konkr\u00e9tn\u00ed p\u0159\u00edpady pou\u017eit\u00ed.<\/div>\n<h3 data-path-to-node=\"83\">Jak zajistit kvalitu dat v data lake?<\/h3>\n<div>Kvalita dat vy\u017eaduje: (1) Standardy kvality \u2013 definov\u00e1n\u00ed toho, co znamen\u00e1 \u201ekvalita\u201c (\u00faplnost, p\u0159esnost, konzistence, v\u010dasnost); (2) Kontroly kvality \u2013 implementace automatizovan\u00fdch valida\u010dn\u00edch pravidel; (3) Monitorov\u00e1n\u00ed \u2013 pr\u016fb\u011b\u017en\u00e1 kontrola dat v\u016f\u010di standard\u016fm; (4) Upozor\u0148ov\u00e1n\u00ed \u2013 notifikace vlastn\u00edk\u016f o probl\u00e9mech s kvalitou; (5) N\u00e1pravu \u2013 stanoven\u00ed proces\u016f pro opravu probl\u00e9m\u016f; (6) Governance \u2013 p\u0159id\u011blen\u00ed vlastn\u00edk\u016f dat odpov\u011bdn\u00fdch za kvalitu; (7) Dokumentaci \u2013 dokumentov\u00e1n\u00ed zdroj\u016f dat a transformac\u00ed; (8) Testov\u00e1n\u00ed \u2013 testov\u00e1n\u00ed datov\u00fdch kan\u00e1l\u016f p\u0159ed nasazen\u00edm do produkce.<\/div>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Co je to Data Lake? Kompletn\u00ed pr\u016fvodce pro l\u00eddry v oblasti IT v podnic\u00edch V \u00e9\u0159e digit\u00e1ln\u00ed transformace se organizace top\u00ed v datech. Ka\u017ed\u00e1 transakce, ode\u010det ze sn\u00edma\u010de, interakce se z\u00e1kazn\u00edkem a provozn\u00ed ud\u00e1lost generuj\u00ed informace, kter\u00e9 by mohly odemknout konkuren\u010dn\u00ed v\u00fdhodu \u2013 pokud byste k nim m\u011bli p\u0159\u00edstup, rozum\u011bli jim a dok\u00e1zali na n\u011b [&hellip;]<\/p>\n","protected":false},"author":7,"featured_media":0,"parent":0,"template":"","glossary-cat":[],"class_list":["post-20217","glossary","type-glossary","status-publish","hentry"],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v27.0 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>Data Lake - Greyson<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/\" \/>\n<meta property=\"og:locale\" content=\"cs_CZ\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Data Lake - Greyson\" \/>\n<meta property=\"og:description\" content=\"Co je to Data Lake? Kompletn\u00ed pr\u016fvodce pro l\u00eddry v oblasti IT v podnic\u00edch V \u00e9\u0159e digit\u00e1ln\u00ed transformace se organizace top\u00ed v datech. Ka\u017ed\u00e1 transakce, ode\u010det ze sn\u00edma\u010de, interakce se z\u00e1kazn\u00edkem a provozn\u00ed ud\u00e1lost generuj\u00ed informace, kter\u00e9 by mohly odemknout konkuren\u010dn\u00ed v\u00fdhodu \u2013 pokud byste k nim m\u011bli p\u0159\u00edstup, rozum\u011bli jim a dok\u00e1zali na n\u011b [&hellip;]\" \/>\n<meta property=\"og:url\" content=\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/\" \/>\n<meta property=\"og:site_name\" content=\"Greyson\" \/>\n<meta property=\"article:modified_time\" content=\"2026-08-14T12:14:33+00:00\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Odhadovan\u00e1 doba \u010dten\u00ed\" \/>\n\t<meta name=\"twitter:data1\" content=\"40 minut\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\/\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/\",\"url\":\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/\",\"name\":\"Data Lake - Greyson\",\"isPartOf\":{\"@id\":\"https:\/\/greyson.eu\/cs\/#website\"},\"datePublished\":\"2026-08-14T12:03:36+00:00\",\"dateModified\":\"2026-08-14T12:14:33+00:00\",\"breadcrumb\":{\"@id\":\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/#breadcrumb\"},\"inLanguage\":\"cs\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/\"]}]},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Domovsk\u00e1 str\u00e1nka\",\"item\":\"https:\/\/greyson.eu\/cs\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"Glossary Terms\",\"item\":\"https:\/\/greyson.eu\/cs\/glossary\/\"},{\"@type\":\"ListItem\",\"position\":3,\"name\":\"Data Lake\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\/\/greyson.eu\/cs\/#website\",\"url\":\"https:\/\/greyson.eu\/cs\/\",\"name\":\"Greyson\",\"description\":\"Let\u2019s make future GREYT together\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\/\/greyson.eu\/cs\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"cs\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Data Lake - Greyson","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/","og_locale":"cs_CZ","og_type":"article","og_title":"Data Lake - Greyson","og_description":"Co je to Data Lake? Kompletn\u00ed pr\u016fvodce pro l\u00eddry v oblasti IT v podnic\u00edch V \u00e9\u0159e digit\u00e1ln\u00ed transformace se organizace top\u00ed v datech. Ka\u017ed\u00e1 transakce, ode\u010det ze sn\u00edma\u010de, interakce se z\u00e1kazn\u00edkem a provozn\u00ed ud\u00e1lost generuj\u00ed informace, kter\u00e9 by mohly odemknout konkuren\u010dn\u00ed v\u00fdhodu \u2013 pokud byste k nim m\u011bli p\u0159\u00edstup, rozum\u011bli jim a dok\u00e1zali na n\u011b [&hellip;]","og_url":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/","og_site_name":"Greyson","article_modified_time":"2026-08-14T12:14:33+00:00","twitter_card":"summary_large_image","twitter_misc":{"Odhadovan\u00e1 doba \u010dten\u00ed":"40 minut"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/","url":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/","name":"Data Lake - Greyson","isPartOf":{"@id":"https:\/\/greyson.eu\/cs\/#website"},"datePublished":"2026-08-14T12:03:36+00:00","dateModified":"2026-08-14T12:14:33+00:00","breadcrumb":{"@id":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/#breadcrumb"},"inLanguage":"cs","potentialAction":[{"@type":"ReadAction","target":["https:\/\/greyson.eu\/cs\/glossary\/data-lake\/"]}]},{"@type":"BreadcrumbList","@id":"https:\/\/greyson.eu\/cs\/glossary\/data-lake\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Domovsk\u00e1 str\u00e1nka","item":"https:\/\/greyson.eu\/cs\/"},{"@type":"ListItem","position":2,"name":"Glossary Terms","item":"https:\/\/greyson.eu\/cs\/glossary\/"},{"@type":"ListItem","position":3,"name":"Data Lake"}]},{"@type":"WebSite","@id":"https:\/\/greyson.eu\/cs\/#website","url":"https:\/\/greyson.eu\/cs\/","name":"Greyson","description":"Let\u2019s make future GREYT together","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/greyson.eu\/cs\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"cs"}]}},"related_terms":"","external_url":"","internal_reference_id":"","_links":{"self":[{"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/glossary\/20217","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/glossary"}],"about":[{"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/types\/glossary"}],"author":[{"embeddable":true,"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/users\/7"}],"version-history":[{"count":2,"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/glossary\/20217\/revisions"}],"predecessor-version":[{"id":20219,"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/glossary\/20217\/revisions\/20219"}],"wp:attachment":[{"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/media?parent=20217"}],"wp:term":[{"taxonomy":"glossary-cat","embeddable":true,"href":"https:\/\/greyson.eu\/cs\/wp-json\/wp\/v2\/glossary-cat?post=20217"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}