Registrera dig för att få de senaste insikterna och uppdateringarna inom teknik, AI och dataanalys, datavetenskap och innovationer från Polestar Analytics.
Redaktörens anmärkning:
I den här artikeln om Data Lakehouse besvarar vi miljondollarfrågan om Data Warehouse kontra Data Lakehouse kontraData Lakegenom att ge en kort sammanfattning av varför och hur det uppstod. Fortsätt läsa om du vill förstå nyanserna hos Lakehouse när det gällerDatabricksochFabric!
Är du i det här tillståndet: Uttråkad av att alla pratar om generationens AI, när det i verkligheten bara är det verkliga hindret bakom det som syns? Data. Beviset på det förvirrade dataekosystemet är det nuvarande data-, maskininlärnings- och AI-landskapet, som ser ut ungefär så här:
TLDR: MAD-landskapet är lika kaotiskt som neurala nätverks dolda lager.
Men med tanke på att 72 % av de högst presterande VD:arna (enligt IBM) säger att konkurrensfördelar beror på vem som har den mest avancerade generativa AI:n och artificiella intelligensen; och att maskininlärning är företagens högsta prioritet (flera rapporter) – anser vi att det är viktigt att ställa frågan: Kan era data faktiskt stödja allt detta?
För att besvara denna fråga, låt oss ta en resa tillbaka i datatidslinjen för att se hur databehoven och datahanteringsbehoven har utvecklats:
Data Lakehouse är en hybridplattform för datalagring och bearbetning som kombinerar det bästa från både traditionella datasjö- och datalagertekniker: billig lagring i ett öppet format som är tillgängligt via en mängd olika system från den förra, och kraftfulla hanterings- och optimeringsfunktioner från den senare.
Lakehouse-arkitekturen,som du kan se i Databricks, Microsoft Fabric etc., syftar till att minska kostnaden, driftskostnaderna och komplexiteten i att överföra data för flera syften, från Business Intelligence till Artificiell Intelligens.
Även om resan för data Lakehouses började med Uber och sedan Netflix, har nu majoriteten av Fortune 500-företagen redan börjat sin resa med dem. Tre av de viktigaste märkbara fördelarna med att använda Data Lakehouse är:
Även om vi har pratat om alla tre och hur utvecklingen inom datahantering har gjort det nödvändigt att ha mer än en av dem, ska vi försöka jämföra dem på enklast möjliga sätt.
Från det framväxande behovet av att förbli flexibel till att anpassa sig snabbt – behovet av att balansera kostnader med det växande behovet av datahantering balanseras med Data Lakehouse.
Skillnader mellan datalager, datasjö och datasjöhus
TL;DR: Data Lakehouse lagrar data i ett liknande format som Data Lake, men det transaktionella metadatalagret definierar vilka objekt som ingår i en tabellversion, som ett datalager. Från den större flexibiliteten i interoperabilitet som Data Lakes och möjligheten till ACID-transaktioner som Data Warehouse – Data Lakehouse är en sammanslagning av båda idéerna.
Syftet bakom varför Data Lakehouse måste vara tydligt vid det här laget. Så, låt oss dyka in i "hur". En vanlig Data Lakehouse-arkitektur består av 5 lager, nämligen:
Med tillkomsten av Microsoft Fabric och One Lake, dvs. Azure Data, har Lakehouse blivit mer mainstream än det var tidigare. Det är värt att nämna att det "kurerade lagret" (i en Microsoft Fabric-arkitektur) kan ersättas med ett datalager vid behov. Lakehouse i Fabric kan skapas mycket enkelt med följande alternativ på plats.
Du kan hitta mer information om Azure Data Lakehouse-arkitektur och var du kan komma igånghär.
Databricks Lakehouse gör det enkelt att automatisera och orkestrera ETL-pipelines. Tidigare har du säkert stött påAzure Databricks(som vanligtvis används medAzure Synapse) eller deras Delta Live-tabeller för att navigera i komplexiteten inom infrastrukturhantering, uppgiftsorkestrering, felhantering etc.
Det finns uppenbarligen andra aktörer på marknaden, bland annat Amazon Redshift, Google Cloud BigQuery, Salesforce Data Cloud, Apache Hudi och fler. De viktigaste övervägandena vid valet mellan dem kan vara: prestanda, kostnad, datamängd, skalbarhet, integrationsmöjligheter och styrning.
Vi har sett fördelarna med Data Lakehouse, från att vara mer ekonomiskt än tvåskiktsarkitekturen, en förenklad arkitektur för databearbetning, ökad tillförlitlighet genom att minska problem med datakvalitet och dubbelarbete, förbättrad styrning med konsolidering, till ökad skalbarhet för framtiden.
I takt med att organisationer inser värdet bakom det, särskilt i denna era av AI, skulle det vara avgörande för att spela en central roll i att driva datadrivet beslutsfattande och innovation. Framtiden för datasjöhus är ljus, och deras fortsatta utveckling kommer utan tvekan att forma nästa generations dataplattformar – allt som återstår är att du anammar det väl.
Prata med våradatateknikexperterför att se var och hur detta passar in i er datahanteringsstrategi.
Om författaren

Data- och BI-beroende
När man teoretiserar före data - Omedvetet börjar man vrida fakta för att passa teorier, istället för teorier för att passa fakta.