Back to Topics Directory
Topic Hub

#spark (30 Repositories)

Ranked open-source repositories tagged with #spark, scored by pull request acceptance likelihood and maintainer engagement velocity.

Topic Avg Merge Rate

78.6%

Avg Review Latency

72.6h

Filter by language

30 repositories tagged #spark

S TierPython 57 1 GFIs

ascii-supply-networks/dagster-slurm

Dagster SLURM integration

96.1%
Merge Rate
<1h
First Review
100%
1st-Timers
4
Maintainers
B TierJava 79

nielsbasjes/splittablegzip

Splittable Gzip codec for Hadoop

95.2%
Merge Rate
-
First Review
100%
1st-Timers
0
Maintainers
A TierScala 324

neo4j/neo4j-spark-connector

Neo4j Connector for Apache Spark, which provides bi-directional read/write access to Neo4j from Spark, using the Spark DataSource APIs

82.3%
Merge Rate
1h
First Review
100%
1st-Timers
11
Maintainers
B TierPython 743

MigoXLab/dingo

Dingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool

100.0%
Merge Rate
14d
First Review
100%
1st-Timers
0
Maintainers
A TierRust 347 3 GFIs

kamu-data/kamu-cli

Next-generation decentralized data lakehouse and a multi-party stream processing network

78.9%
Merge Rate
23h
First Review
100%
1st-Timers
5
Maintainers
A TierJava 3.4k

apache/paimon

Apache Paimon is a lake format that enables building a Realtime Lakehouse Architecture with Flink and Spark for both streaming and batch operations.

83.1%
Merge Rate
1d
First Review
77%
1st-Timers
64
Maintainers
A TierRust 1.8k 2 GFIs

apache/auron

The Auron accelerator for distributed computing framework (e.g., Spark) leverages native vectorized execution to accelerate query processing

75.0%
Merge Rate
2h
First Review
67%
1st-Timers
14
Maintainers
A TierJava 6.7k

apache/zeppelin

Web-based notebook that enables data-driven, interactive data analytics and collaborative documents with SQL, Scala and more.

82.5%
Merge Rate
6h
First Review
78%
1st-Timers
21
Maintainers
B TierScala 210

starlake-ai/starlake

Declarative text based tool for data analysts and engineers to extract, load, transform and orchestrate their data pipelines.

94.1%
Merge Rate
4d
First Review
100%
1st-Timers
0
Maintainers
A TierScala 170

AbsaOSS/cobrix

A COBOL parser and Mainframe/EBCDIC data source for Apache Spark

100.0%
Merge Rate
6d
First Review
100%
1st-Timers
2
Maintainers
A TierScala 1.2k

graphframes/graphframes

GraphFrames is a package for Apache Spark which provides DataFrame-based Graphs

65.3%
Merge Rate
2h
First Review
60%
1st-Timers
13
Maintainers
A TierScala 5.2k

microsoft/SynapseML

Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark

71.7%
Merge Rate
<1h
First Review
60%
1st-Timers
5
Maintainers
A TierScala 117

alexarchambault/ammonite-spark

Run spark calculations from Ammonite

76.5%
Merge Rate
5h
First Review
100%
1st-Timers
2
Maintainers
A TierJava 3.2k

lakesoul-io/LakeSoul

LakeSoul is an end-to-end, realtime cloud-native Lakehouse framework for fast data ingestion, concurrent updates, incremental analytics, multimodal data processing and vector search — powering next-generation BI and AI workloads.

84.6%
Merge Rate
3d
First Review
100%
1st-Timers
3
Maintainers
A TierJava 1.5k

projectnessie/nessie

Nessie: Transactional Catalog for Data Lakes with Git-like semantics

88.0%
Merge Rate
23h
First Review
60%
1st-Timers
15
Maintainers
A TierScala 1.3k 8 GFIs

apache/datafusion-comet

Apache DataFusion Comet Spark Accelerator

68.2%
Merge Rate
3d
First Review
53%
1st-Timers
36
Maintainers
A TierScala 4.2k

JohnSnowLabs/spark-nlp

State of the Art Natural Language Processing

73.9%
Merge Rate
2h
First Review
75%
1st-Timers
6
Maintainers
B TierScala 1.6k

almond-sh/almond

A Scala kernel for Jupyter

74.4%
Merge Rate
<1h
First Review
67%
1st-Timers
1
Maintainers
A TierScala 959

apache/livy

Apache Livy is an open source REST interface for interacting with Apache Spark from anywhere.

60.7%
Merge Rate
3h
First Review
75%
1st-Timers
9
Maintainers
A TierScala 998

NVIDIA/cudf-spark

NVIDIA cuDF for Apache Spark plugin - accelerate Apache Spark with GPUs

76.6%
Merge Rate
5d
First Review
76%
1st-Timers
34
Maintainers
A TierC# 2.1k

dotnet/spark

.NET for Apache® Spark™ makes Apache Spark™ easily accessible to .NET developers.

100.0%
Merge Rate
<1h
First Review
100%
1st-Timers
2
Maintainers
A TierShell 857

awslabs/data-on-eks

DoEKS is a tool to build, deploy and scale Data Platforms on Amazon EKS

84.7%
Merge Rate
11d
First Review
71%
1st-Timers
6
Maintainers
B TierRust 3.3k 2 GFIs

lakehq/sail

Drop-in Apache Spark replacement written in Rust, unifying batch processing, stream processing, and compute-intensive AI workloads.

68.3%
Merge Rate
4d
First Review
67%
1st-Timers
20
Maintainers
B TierScala 1.5k

apache/carbondata

High performance data store solution

100.0%
Merge Rate
3d
First Review
100%
1st-Timers
1
Maintainers
B TierJava 2.0k

broadinstitute/gatk

Official code repository for GATK versions 4 and up

56.3%
Merge Rate
2h
First Review
40%
1st-Timers
6
Maintainers
B TierScala 956

delta-io/delta-sharing

An open protocol for secure data sharing

80.2%
Merge Rate
14d
First Review
60%
1st-Timers
6
Maintainers
B TierJava 1.2k

zinggAI/zingg

Scalable master data management, identity resolution, entity resolution, and deduplication using ML

50.0%
Merge Rate
3d
First Review
100%
1st-Timers
4
Maintainers
B TierScala 3.6k

awslabs/deequ

Deequ is a library built on top of Apache Spark for defining "unit tests for data", which measure data quality in large datasets.

90.0%
Merge Rate
14d
First Review
100%
1st-Timers
0
Maintainers
B TierJava 1.2k 1 GFIs

apache/amoro

Apache Amoro(incubating) is a Lakehouse management system built on open data lake formats.

69.5%
Merge Rate
2d
First Review
59%
1st-Timers
17
Maintainers
B TierJava 603

igniterealtime/Spark

Cross-platform real-time collaboration client optimized for business and organizations.

33.3%
Merge Rate
<1h
First Review
40%
1st-Timers
1
Maintainers
Best Spark Open Source Repositories & C-Rank™ | GetMerged