Back to Topics Directory
Topic Hub

#apache-spark (24 Repositories)

Ranked open-source repositories tagged with #apache-spark, scored by pull request acceptance likelihood and maintainer engagement velocity.

Topic Avg Merge Rate

16.2%

Avg Review Latency

5.4h

Filter by language

24 repositories tagged #apache-spark

A TierPython 27.7k 6 GFIs

mlflow/mlflow

The open source AI engineering platform for agents, LLMs, and ML models. MLflow enables teams of all sizes to debug, evaluate, monitor, and optimize production-quality AI applications while controlling costs and managing access to models and data.

65.7%
Merge Rate
16h
First Review
33%
1st-Timers
104
Maintainers
A TierScala 1.2k

graphframes/graphframes

GraphFrames is a package for Apache Spark which provides DataFrame-based Graphs

65.3%
Merge Rate
2h
First Review
60%
1st-Timers
13
Maintainers
B TierPython 188

kubeflow/mcp-apache-spark-history-server

MCP Server and CLI for Apache Spark History Server. Debug Spark applications from AI agents, scripts, or the terminal.

95.0%
Merge Rate
4d
First Review
100%
1st-Timers
1
Maintainers
B TierC# 902

aloneguid/parquet-dotnet

Fully managed Apache Parquet implementation

62.5%
Merge Rate
16h
First Review
100%
1st-Timers
1
Maintainers
C TierScala 828

LucaCanali/sparkMeasure

This repository contains the development code for sparkMeasure, an Apache Spark performance analysis and troubleshooting library. It simplifies collecting, aggregating, and exporting Spark task/stage metrics, and is designed for practical use by developers and data engineers in interactive analysis, testing, and production monitoring workflows.

100.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 1.9k

feathr-ai/feathr

Feathr – A scalable, unified data and AI engineering platform for enterprise

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 120

streamnative/pulsar-spark

Spark Connector to read and write with Pulsar

0.0%
Merge Rate
-
First Review
0%
1st-Timers
1
Maintainers
D TierScala 131

MemVerge/splash

Splash, a flexible Spark shuffle manager that supports user-defined storage backends for shuffle data storage and exchange

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 326

Hydrospheredata/mist

Serverless proxy for Spark cluster

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierHAHaskell 449

tweag/sparkle

Haskell on Apache Spark.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 349

opencypher/morpheus

Morpheus brings the leading graph query language, Cypher, onto the leading distributed processing platform, Spark.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 106

jgperrin/net.jgp.books.spark.ch01

Spark in Action, 2nd edition - chapter 1 - Introduction

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 187

vinta/albedo

A recommender system for discovering GitHub repos, built with Apache Spark

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 150

SANSA-Stack/SANSA-Stack

Big Data RDF Processing and Analytics Stack built on Apache Spark and Apache Jena http://sansa-stack.github.io/SANSA-Stack/

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 498

cartershanklin/pyspark-cheatsheet

PySpark Cheat Sheet - example code to help you learn PySpark and develop apps faster

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierHTML 299

MingChen0919/learning-apache-spark

Notes on Apache Spark (pyspark)

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 158

archivesunleashed/aut

The Archives Unleashed Toolkit is an open-source toolkit for analyzing web archives.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierTypeScript 490

dataflint/spark

Drop-in replacement for Apache Spark UI

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 1.4k

databricks/LearningSparkV2

This is the github repo for Learning Spark: Lightning-Fast Data Analytics [2nd Edition]

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 239

Azure/azure-event-hubs-spark

Enabling Continuous Data Processing with Apache Spark and Azure Event Hubs

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 339

dmmiller612/sparktorch

Train and run Pytorch models on Apache Spark.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 268

hortonworks-spark/spark-atlas-connector

A Spark Atlas connector to track data lineage in Apache Atlas

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierPython 3.1k

kubeflow/spark-operator

Kubernetes operator for managing the lifecycle of Apache Spark applications on Kubernetes.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierScala 345

datamechanics/delight

A Spark UI and Spark History Server alternative with CPU and Memory metrics! Delight is free, cross-platform, and open-source.

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
Best Apache-spark Open Source Repositories & C-Rank™ | GetMerged