Agile Data Engine: Modernse andmeplatvormi ehitus metaandmete ja AI abil

‍ Organisatsioonid genereerivad ja koguvad üha rohkem andmeid, vaatamata sellele on ettevõtted raskustes nendest andmetest väärtuse kätte saamisega. Andmetiimidelt oodatakse andmetoodete kiiret tarnimist, üha suurema arvu analüütiliste kasutusjuhtude toetamist, andmete ettevalmistust AI initsiatiivideks ja pidevat kohanemist muutuvatele ärinõuetele.

Traditsioonilised andmeplatvormid tuginevad sageli mitmele eraldiseisvale tööriistale, custom SQL ja Pythoni skriptidele, manuaalsetele juurutusprotsessidele ja suuremahulisele arendustööle. Mida suuremaks kasvab andmeplatvorm, seda keerulisemaks muutub ka selle haldamine, hooldamine ja tulevaste arenduste juurutamine. Kui andmeplatvorm koosneb sadadest pipeline’idest ja tuhandetest SQL-failidest, võib ühe lähteandmete tabeli muudatus tähendada paljude erinevate skriptide, sõltuvuste ja pipeline’de käsitsi uuendamist.

Andmeladude ja ELT/ETL pipeline’de transformatsioonikihi arenduse lihtsustamiseks on Soome päritolu ettevõtte arendanud DataOps tööriista nimega Agile Data Engine (ADE).

Mis on Agile Data Engine?‍ ‍

Selle asemel, et käsitleda andmeinseneeriat üksikute programmeerimisülesannetena on ADE metaandmete põhine DataOps platvorm, mis automatiseerib kaasaegsete andmeladude ja lakehouse’ide arendamise ja haldamise. Platvorm ühendab low-code arenduse, automatiseerimise, pipeline’de arenduse ja andmehalduse (data governance) ühtseks tervikuks, aidates organisatsioonidel luua usaldusväärseid andmetooteid kiiremini ja efektiivsemalt.

Selle asemel, et kirjutada ja hooldada suures mahus SQL-koodi, kirjeldavad andmeinsenerid andmemudeleid ja transformatsioone struktureeritud metaandmete ja mallide (template) abil. Nende metaandmete põhjal genereerib ADE automaatselt:

  • SQL-transformatsioonid

  • Andmebaasi objektid

  • Orkestreerimise töövood (Airflow DAGs)

  • Juurutustorud (deployment pipelines)

  • Dokumentatsiooni

  • Andmete päritolu (data lineage)

  • Testid ja valideerimiskomponendid

Agile Data Engine (ADE) on täielikult manageeritud SaaS platvorm, mis ühendub andmelaoga (Snowflake, Databricks, Fabric jne). ADE-s kirjeldatud andmebaasiobjektid realiseeritakse andmelaos automaatselt kasutades CI/CD pipeline, ning ADE-s kirjeldatud transformatsioonid, sõltuvused ja laadimised realiseeritakse automaatselt koostatud Airflow DAG-ide abil. Seejuures kõik reaalsed andmed püsivad andmelaos, ning ADE-s on ainult andmeid ja andmebaasiobjekte kirjeldavad metaandmed.

Miks kasutada Agile Data Engine’t?

Selle asemel et andmeinsenerid arendavad ja haldavad sadu või tuhandeid SQL skripte, haldavad nad metaandmeid, mis kirjeldavad, mida platvorm peaks juurutama andmelao poolel. See eraldatus äriliste vajaduste kirjelduse ja tehnilise implementatsiooni vahel annab mitmeid eeliseid:

  • Kiirem arendustsükkel - vähem käsitsi kirjutamist ja rohkem automaatselt genereeritavaid komponente

  • Lihtsam haldus/hooldus - muudatused tehakse metaandmetes, mitte kümnetes eraldiseisvates päringutes või skriptides

  • Järjepidevad implementatsioonimustrid - mallid tagavad, et sarnaseid probleeme lahendatakse ühte moodi

  • Parem andmehaldus - metaandmed, lineage, dokumentatsioon ja versioonihaldus on osa samast arenduprotsessist

  • Vähendatud tehniline võlg - vähem käsitsi hooldatavat koodi, erinevaid arendusmustreid ja kiirem arendustsükkel aitavad vähendada tehnilist võlga

Seda kõike aitavad saavutada erinevad ADE funktsionaalsused nagu sisseehitatud versioonikontroll ja CI/CD, automatiseeritud skeemi muudatused, taaskasutatavad mallid, metaandmetel põhinev töövoo automatiseerimine, sisseehitatud monitoorimine jne. Pikemat nimekirja erinevatest funktsionaalsustest on võimalik näha siit: https://www.agiledataengine.com/data-teams

Oluline erinevus traditsioonilisest lähenemisest seisneb selles, et arendusmeeskond ei pea enam iga muudatuse puhul käsitsi haldama kogu tehnilist teostust. Kui ärinõuded, andmemudelid ja transformatsioonid on kirjeldatud metaandmetena, saab sama infot kasutada SQL-i, töövoogude, dokumentatsiooni, testide ja teiste tehniliste komponentide genereerimiseks. See vähendab käsitöö osakaalu ning muudab muudatuste tegemise kiiremaks ja kontrollitumaks.

Samuti muutub andmeplatvormi arendamine standardiseeritumaks. Taaskasutatavad mallid ja ühtsed arendusmustrid aitavad vältida olukorda, kus iga arendaja lahendab sama tüüpi probleeme erinevalt. See on eriti oluline suurtemate andmeplatvormide puhul, kus keerukus ja arendusmeeskonna suurus aja jooksul kasvab.


Agile Data Agent (ADA) - Tehisintellekt metaandmete põhise arenduse assistendina

Sellel aastal tuli Agile Data Engine välja ka uue tootega nimega Agile Data Agent (ADA). ADA näol on tegemist AI-l põhineva metaandmete genereerimise tööriistana, mis on disainitud spetsiifiliselt Agile Data Engine jaoks.

AI on pidevalt muutmas tarkvaraarendust, kuid andmeinseneerias ei piisa ainult sellest, et suur keelemudel genereerib SQL koodi. Seetõttu läheneb Agile Data Agent (ADA) probleemile teisiti - selle asemel, et luua otse tootmiskõlbulikku SQL koodi, genereerib ADA struktureeritud metaandmeid, mis vastavad ADE modelleerimisstandarditele ja andmehalduse põhimõtetele. ADA ei vastuta lõpliku tehnilise teostuse eest, vaid toimib intelligentse projekteerimise/modelleerimise assistendina, samal ajal kui Agile Data Engine genereerib kontrollitud ja järjepideva lõpp-lahenduse.

Tüüpiline protsess ADA kasutamisel näeb välja selline:‍ ‍

  1. Arendaja kirjeldab ärivajaduse loomulikus keeles

  2. ADA analüüsib nõudeid ning pakub välja esialgsed andmemudelid

  3. Süsteem kasutab olemasolevaid metaandmeid konteksti loomiseks

  4. Agent genereerib vajalikud metaandmed mudelite, seoste ja transformatsioonide kohta

  5. Arendaja valideerib tulemuse

  6. Metaandmed salvestatakse ADE-sse API või MCP kaudu

  7. ADE genereerib automaatselt SQL-i ja andmeobjekti kirjeldavad metaandmed

  8. Lahendus realiseeritakse andmelao arendus/test keskkonnas valideerimiseks

Näiteks võib arendaja anda ADA-le sisendi: “Loo kliendimüügi andmemudel, kus iga kliendi kohta on võimalik analüüsida tema tellimuste koguväärtust, tellimuste arvu ja viimase tellimuse kuupäeva”. ADA saab selle põhjal pakkuda välja vajaliku mudeli, atribuudid, seosed ja transformatsioonid. Arendaja kontrollib tulemuse ning pärast kinnitamist saab ADE genereerida vajalikud tehnilised komponendid.

Selline protsess võimaldab arendajal olla kogu arendusprotsessi juures, ning kasutada AI-d arendusprotsessi efektiivsemaks muutmist säilitades samal ajal usaldusväärsuse, läbipaistvuse ja kontrolli.

Agile Data Engine’i väärtus ei seisne ainult üksikute andmeinseneeria ülesannete automatiseerimises. Olulisem muutus on selles, kuidas andmeplatvormi arendatakse: tehnilise koodi asemel hallatakse metaandmeid, metaandmetest genereeritakse vajalikud tehnilised komponendid ning nüüd saab ka AI osaleda selle protsessis, genereerides ja täiendades sama metaandmekihti. See loob protsessi, kus AI aitab arendajal kiiremini lahenduseni jõuda ilma ohverdamata üsaldusväärsust, läbipaistvust ega kontrolli. ‍

Next
Next

Andmeanalüütika ja AI kasutamine keskmise suurusega ettevõttes