sorodni izrazi in sinonimi v sodobni slovenščini, hrvaščini in srbščini
Podobnost besed in fraz med rezultati je odvisna od tega, kolikokrat se beseda ali fraza pojavi v podobnem stavčnem kontekstu kot "apache spark".
Pogosto skupaj z
Primeri iz korpusa
Korpus Common Crawl
Common Crawl je korpus spletnih strani
Apache Spark nam omogoča, da v naloženo bazo podatkov konstantno dodajamo nove vnose, ki pa ne vplivajo na proces izvajanja nadaljnjih analiz.
Apache Spark upošteva podatkovno shemo (določi jo avtomatsko ob branju podatkov) samo pri branju, ne pa tudi pri pisanju.
Apache Spark je odprtokodna, distribuirana računalniška platforma, zasnovana za hitro in učinkovito obdelavo velike količine podatkov.
Apache Spark je poenoten analitični pogon (angl. engine) za obsežno obdelavo podatkov.
Edina prava rešitev je horizontalno skaliranje procesne moči med več strežnikov, kar nam omogoča orodje za distribuirano obdelavo podatkov Apache Spark.
Databricks je zmogljiva enotna analitična platforma, zasnovana na Apache Spark, ki poenostavlja delovne tokove za obdelavo podatkov, strojno učenje in analitiko.
Tudi ni zaželeno uporabljati imen stolpcev, ki se razlikujejo samo v velikih ali malih črkah (Apache Spark, brez datuma a).
Obe orodji sta odprtokodni in brezplačni za uporabo ter primerni za obdelavo masovnih podatkov (Apache Spark, brez datuma b).
Apache Spark sledi nekoliko podobnemu konceptu, vendar ga zaradi pomanjkanja podpore za Windows nismo mogli uporabljati v porazdeljenem načinu.
V nadaljevanju sem podrobno predstavil Apache Spark kot sodobno odprtokodno orodje za distribuirano obdelavo velikih količin podatkov.
Priporočeno je, da se izogibamo teh funkcij pri obdelavi velikih podatkov (Apache Spark, brez datuma a).
Vendar menimo, da bi se s poglobljenim razumevanjem Daska lahko še bolj približali času, ki ga je za poizvedbo potreboval Apache Spark.
Apache Spark se pogosto navaja kot alternativni oziroma nadgrajeni pristop v primerjavi z MapReduce.
Operacija prepisovanja v Apache Spark ni atomična [95], temveč je sestavljena iz operacije brisanja in pisanja.
Apache Spark - splošno in hitro ogrodje za procesiranje masovnih podatkovnih zbirk, 100krat hitrejše od Hadoop-a (rdatamining.com 2015).
Številni priljubljeni projekti (kot je Apache Spark) uporabljajo Arrow za učinkovito pošiljanje stolpčnih podatkov ali kot temelje za izdelavo analitičnih orodij [9].
Brez posebnih optimizacij pri obeh programih je bil Apache Spark pri izvajanju poizvedbe za izračun pogostosti parov časovno učinkovitejši od Daska (tabela 6.11).
Apache Spark je potreboval več konfiguracije in iskanja ustreznih dodatnih knjižnic za podporo S3.
Zaključim lahko, da Apache Spark v kombinaciji s platformo Databricks predstavlja močno in fleksibilno rešitev za sodobne izzive podatkovnega inženiringa.
Tabela 5.7: Primerjava časa pri uporabi knjižnice pyarrow za pospešitev pretvorbe iz podatkovnega okvirja iz Apache Spark v podatkovni okvir iz pandas (primer 5.8).