Back to Topics Directory
Topic Hub

#big-data (30 Repositories)

Ranked open-source repositories tagged with #big-data, scored by pull request acceptance likelihood and maintainer engagement velocity.

Topic Avg Merge Rate

77.2%

Avg Review Latency

58.3h

Filter by language

30 repositories tagged #big-data

S TierC# 254

G-Research/ParquetSharp

ParquetSharp is a .NET library for reading and writing Apache Parquet files.

89.5%
Merge Rate
2h
First Review
100%
1st-Timers
5
Maintainers
S TierShell 243

firebolt-db/firebolt-core

Firebolt Core is a free, self-hosted edition of Firebolt's distributed query engine (https://www.firebolt.io/); it provides high-performance data warehousing capabilities that can be deployed anywhere from a single laptop to enterprise datacenters.

95.7%
Merge Rate
3h
First Review
67%
1st-Timers
2
Maintainers
S TierJava 2.3k

apache/ambari

Apache Ambari simplifies provisioning, managing, and monitoring of Apache Hadoop clusters.

94.7%
Merge Rate
1h
First Review
100%
1st-Timers
2
Maintainers
A TierRust 194

apache/paimon-rust

Apache Paimon Rust The rust implementation of Apache Paimon.

89.0%
Merge Rate
7h
First Review
88%
1st-Timers
25
Maintainers
A TierRust 2.1k 7 GFIs

apache/datafusion-ballista

Apache DataFusion Ballista Distributed Query Engine

78.7%
Merge Rate
1d
First Review
62%
1st-Timers
27
Maintainers
A TierJava 7.1k

vespa-engine/vespa

The AI search platform

92.0%
Merge Rate
7d
First Review
93%
1st-Timers
38
Maintainers
A TierJava 12.0k 6 GFIs

StarRocks/starrocks

The world's fastest open query engine for sub-second analytics both on and off the data lakehouse. With the flexibility to support nearly any scenario, StarRocks provides best-in-class performance for multi-dimensional analytics, real-time analytics, and ad-hoc queries. A Linux Foundation project.

74.8%
Merge Rate
22h
First Review
53%
1st-Timers
84
Maintainers
A TierJava 3.4k

apache/paimon

Apache Paimon is a lake format that enables building a Realtime Lakehouse Architecture with Flink and Spark for both streaming and batch operations.

83.1%
Merge Rate
1d
First Review
77%
1st-Timers
64
Maintainers
A TierRust 1.8k 2 GFIs

apache/auron

The Auron accelerator for distributed computing framework (e.g., Spark) leverages native vectorized execution to accelerate query processing

75.0%
Merge Rate
2h
First Review
67%
1st-Timers
14
Maintainers
A TierJava 483

gchq/stroom

Stroom is a highly scalable data storage, processing and analysis platform.

84.8%
Merge Rate
2d
First Review
67%
1st-Timers
4
Maintainers
A TierJava 6.4k 5 GFIs

apache/iotdb

Apache IoTDB

81.5%
Merge Rate
3d
First Review
66%
1st-Timers
31
Maintainers
A TierJava 6.7k

apache/zeppelin

Web-based notebook that enables data-driven, interactive data analytics and collaborative documents with SQL, Scala and more.

82.5%
Merge Rate
6h
First Review
78%
1st-Timers
21
Maintainers
A TierShell 1.1k

ClickHouse/ClickBench

ClickBench: a Benchmark For Analytical Databases

81.4%
Merge Rate
1d
First Review
73%
1st-Timers
24
Maintainers
A TierScala 1.2k

graphframes/graphframes

GraphFrames is a package for Apache Spark which provides DataFrame-based Graphs

65.3%
Merge Rate
2h
First Review
60%
1st-Timers
13
Maintainers
A TierJava 219

apache/knox

Mirror of Apache Knox

83.3%
Merge Rate
6d
First Review
75%
1st-Timers
11
Maintainers
A TierJava 201 5 GFIs

apache/tsfile

Apache TsFile

76.7%
Merge Rate
3d
First Review
60%
1st-Timers
14
Maintainers
A TierRust 9.2k 16 GFIs

apache/datafusion

Apache DataFusion SQL Query Engine

62.5%
Merge Rate
20h
First Review
59%
1st-Timers
149
Maintainers
A TierMDMDX 132

apache/doris-website

Apache Doris Website

79.7%
Merge Rate
3d
First Review
70%
1st-Timers
10
Maintainers
A TierC++ 49.5k 1 GFIs

ClickHouse/ClickHouse

ClickHouse® is a real-time analytics database management system

67.0%
Merge Rate
7h
First Review
50%
1st-Timers
209
Maintainers
A TierJava 1.3k

apache/ozone

Scalable, reliable, distributed storage system optimized for data analytics and object store workloads.

74.9%
Merge Rate
2d
First Review
64%
1st-Timers
69
Maintainers
A TierScala 998

NVIDIA/cudf-spark

NVIDIA cuDF for Apache Spark plugin - accelerate Apache Spark with GPUs

76.6%
Merge Rate
5d
First Review
76%
1st-Timers
34
Maintainers
B TierPython 188

kubeflow/mcp-apache-spark-history-server

MCP Server and CLI for Apache Spark History Server. Debug Spark applications from AI agents, scripts, or the terminal.

95.0%
Merge Rate
4d
First Review
100%
1st-Timers
1
Maintainers
A TierJava 8.7k 5 GFIs

apache/beam

Apache Beam is a unified programming model for Batch and Streaming data processing.

74.0%
Merge Rate
2d
First Review
56%
1st-Timers
57
Maintainers
A TierC++ 651 3 GFIs

uxlfoundation/oneDAL

oneAPI Data Analytics Library (oneDAL)

54.3%
Merge Rate
5h
First Review
63%
1st-Timers
12
Maintainers
A TierJava 16.7k 3 GFIs

prestodb/presto

The official home of the Presto distributed SQL query engine for big data

57.2%
Merge Rate
1d
First Review
48%
1st-Timers
70
Maintainers
A TierScala 743

TouK/nussknacker

Low-code tool for automating actions on real time data | Stream processing for the users.

81.4%
Merge Rate
20d
First Review
100%
1st-Timers
4
Maintainers
A TierJava 5.2k

apache/calcite

Apache Calcite

73.2%
Merge Rate
1d
First Review
68%
1st-Timers
43
Maintainers
A TierJava 13.2k 10 GFIs

trinodb/trino

Official repository of Trino, the distributed SQL query engine for big data, formerly known as PrestoSQL (https://trino.io)

60.9%
Merge Rate
2d
First Review
41%
1st-Timers
94
Maintainers
A TierJava 2.1k 3 GFIs

apache/fluss

Apache Fluss is a streaming storage built for real-time analytics.

62.5%
Merge Rate
2d
First Review
44%
1st-Timers
56
Maintainers
B TierRust 3.3k 2 GFIs

lakehq/sail

Drop-in Apache Spark replacement written in Rust, unifying batch processing, stream processing, and compute-intensive AI workloads.

68.3%
Merge Rate
4d
First Review
67%
1st-Timers
20
Maintainers
Best Big-data Open Source Repositories & C-Rank™ | GetMerged