Data-integratie

89 projecten in Data & analyse

Kestra

@kestra-io

Event-driven, language-agnostic platform to create, schedule, and monitor workflows. In code. Coordinate data pipelines and tasks such as ETL and ELT.

Zelf te hosten Apache-2.0 Commit 1 dag geleden ★ 28.364
76 5/5 gemeten

vector

@vectordotdev

A high-performance observability data pipeline.

MPL-2.0 Commit 1 dag geleden ★ 22.616
75 4/5 gemeten

prefect

@PrefectHQ

Prefect is a workflow orchestration framework for building resilient data pipelines in Python.

Apache-2.0 Commit vandaag ★ 23.930
72 5/5 gemeten

whodb

@clidey

Where data access meets operational intelligence

Zelf te hosten Apache-2.0 Commit vandaag ★ 5.030
70 4/5 gemeten

steampipe

@turbot

Zero-ETL, infinite possibilities. Live query APIs, code & more with SQL. No DB required.

AGPL-3.0 Commit 1 dag geleden ★ 7.964
69 5/5 gemeten

egeria

@odpi

Egeria core

Apache-2.0 Commit 1 dag geleden ★ 924
67 5/5 gemeten

flink-cdc

@apache

Flink CDC is a streaming data integration tool

Apache-2.0 Commit vandaag ★ 6.481
67 4/5 gemeten

awesome-dbt

@Hiflylabs

A curated list of awesome dbt resources

Maintainer in de EU GPL-3.0 Commit 21 dagen geleden ★ 1.730
67 4/5 gemeten

airbyte

@airbytehq

Open-source data movement for ELT pipelines and AI agents — from APIs, databases & files to warehouses, lakes, and AI applications. Both self-hosted and Cloud.

Zelf te hosten Commit vandaag ★ 22.140
66 5/5 gemeten

hudi

@apache

Upserts, Deletes And Incremental Processing on Big Data.

Apache-2.0 Commit vandaag ★ 6.275
66 5/5 gemeten

reductstore

@reductstore

High-performance, time-indexed object storage for robotics and industrial IoT

Maintainer in de EU Apache-2.0 Commit 3 dagen geleden ★ 371
65 4/5 gemeten

jitsu

@jitsucom

Jitsu is an open-source Segment alternative. Fully-scriptable data ingestion engine for modern data teams. Set-up a real-time data pipeline in minutes, not days

MIT Commit 1 dag geleden ★ 5.091
65 5/5 gemeten

od

@kokes

Česká otevřená data

Maintainer in de EU MPL-2.0 Commit 29 dagen geleden ★ 138
64 4/5 gemeten

devlake

@apache

Apache DevLake is an open-source dev data platform to ingest, analyze, and visualize the fragmented data from DevOps tools, extracting insights for engineering excellence, developer experience, and community growth.

Apache-2.0 Commit 2 dagen geleden ★ 3.149
64 4/5 gemeten

proton

@timeplus-io

The Fastest Unified Streaming SQL Engine in a Single C++ Binary. ⚡ Millisecond latency. 100+ GB/s throughput. Continuously compute real-time context from streams, logs, metrics, events, and CDC.

Apache-2.0 Commit 6 dagen geleden ★ 2.260
64 4/5 gemeten

aws-sdk-pandas

@aws

pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Parquet, CSV, JSON and EXCEL).

Apache-2.0 Commit vandaag ★ 4.119
64 4/5 gemeten

meltano

@meltano

Meltano: the declarative code-first data integration engine that powers your wildest data and ML-powered product ideas. Say goodbye to writing, maintaining, and scaling your own API integrations.

MIT Commit 1 dag geleden ★ 2.637
64 4/5 gemeten

desbordante-core

@Desbordante

Desbordante is a high-performance data profiler that is capable of discovering many different patterns in data using various algorithms. It also allows to run data cleaning scenarios using these algorithms. Desbordante has a console version and an easy-to-use web application.

AGPL-3.0 Commit 1 dag geleden ★ 508
63 4/5 gemeten

duckle

@slothflowlabs

Open-source ETL/ELT you deploy on your own servers or cloud. Built on DuckDB: no-code/low-code visual pipelines or SQL, 385 components, dbt, CDC, data quality, reverse ETL, lineage, MCP for AI agents. No vendor cloud, no per-row billing.

Zelf te hosten Apache-2.0 Commit 1 dag geleden ★ 1.326
63 4/5 gemeten

squid-sdk

@subsquid

TypeScript ETL toolkit for indexing Ethereum, Solana, and Substrate data, sourced from SQD Network.

Apache-2.0 Commit 1 dag geleden ★ 1.341
62 4/5 gemeten

Cookbook

@andkret

The Data Engineering Cookbook

Apache-2.0 Commit 2 maanden geleden ★ 15.440
60 5/5 gemeten

hop

@apache

Hop Orchestration Platform

Apache-2.0 Commit vandaag ★ 1.477
60 4/5 gemeten

gspread-pandas

@Paradigmllc

Read and write Google Sheets as pandas DataFrames — column-matched appends, real dtypes, and layout detection for sheets that don't start at A1.

BSD-3-Clause Commit 1 maand geleden ★ 414
58 4/5 gemeten

odd-platform

@opendatadiscovery

First open-source data discovery and observability platform. We make a life for data practitioners easy so you can focus on your business.

Apache-2.0 Commit 4 dagen geleden ★ 1.431
58 4/5 gemeten

riko

@nerevu

A Python stream processing engine modeled after Yahoo! Pipes

MIT Commit 1 dag geleden ★ 1.607
58 5/5 gemeten

pyjanitor

@pyjanitor-devs

Clean APIs for data cleaning. Python implementation of R package Janitor

MIT Commit vandaag ★ 1.500
58 5/5 gemeten

datacontract-cli

@datacontract

Enforce Data Contracts

MIT Commit 1 dag geleden ★ 1.071
58 4/5 gemeten

pathway

@pathwaycom

Python ETL framework for stream processing, real-time analytics, LLM pipelines, and RAG.

Commit 1 dag geleden ★ 62.236
57 4/5 gemeten

lakeFS

@treeverse

lakeFS - Data version control for your data lake | Git for data

Commit 1 dag geleden ★ 5.542
57 5/5 gemeten

fluvio

@fluvio-community

🦀 event stream processing for developers to collect and transform data in motion to power responsive data intensive applications.

Apache-2.0 Commit 27 dagen geleden ★ 5.258
57 4/5 gemeten

chunjun

@DTStack

A data integration framework

Apache-2.0 Commit 10 maanden geleden ★ 4.100
57 4/5 gemeten

tis

@datavane

Support agile Ontology DataOps Based on Flink, DataX and Flink-CDC with Web-UI

Apache-2.0 Commit 9 dagen geleden ★ 1.417
57 4/5 gemeten

bacalhau

@bacalhau-project

Community-driven, simple, yet powerful framework for fast, cost-effective distributed Compute over Data.

Apache-2.0 Commit 1 dag geleden ★ 871
56 5/5 gemeten

soda-core

@sodadata

Data Contracts engine for the modern data stack. https://www.soda.io

Maintainer in de EU Commit 2 dagen geleden ★ 2.429
56 4/5 gemeten

doit

@pydoit

CLI task management & automation tool

MIT Commit 5 dagen geleden ★ 2.087
56 5/5 gemeten

open-data-contract-standard

@bitol-io

Home of the Open Data Contract Standard (ODCS).

Apache-2.0 Commit 15 dagen geleden ★ 1.153
56 4/5 gemeten

Knowledge-Graph-Tutorials-and-Papers

@heathersherry

Insightful Tutorials and Papers about Knowledge Graphs

MIT Commit 1 dag geleden ★ 1.072
56 4/5 gemeten

data-engineering-zoomcamp

@DataTalksClub

Data Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. Join the course here 👇🏼

Commit 11 dagen geleden ★ 45.817
55 4/5 gemeten

zerocode

@authorjapps

zerocode-tdd is a community-developed, free, open-source, outcome-driven automated testing framework for Data Pipelines, ETL, REST API, Kafka(Data Streams), Databases and Load scenarios. all defined in simple JSON or YAML — with zero coding.

Apache-2.0 Commit 4 dagen geleden ★ 1.014
55 5/5 gemeten

sling-cli

@slingdata-io

Sling is a CLI tool that extracts data from a source storage/database and loads it in a target storage/database.

GPL-3.0 Commit 1 dag geleden ★ 910
55 5/5 gemeten

spark

@dataflint

Drop-in replacement for Apache Spark UI

Apache-2.0 Commit 1 maand geleden ★ 491
54 4/5 gemeten

connect

@redpanda-data

Fancy stream processing made operationally mundane

Commit vandaag ★ 8.768
53 4/5 gemeten

xonsh

@xonsh

🐚 Python-powered shell. Full-featured, cross-platform and AI-friendly.

Commit 4 dagen geleden ★ 9.652
52 5/5 gemeten

ingestr

@bruin-data

ingestr is a CLI tool to copy data between any databases with a single command seamlessly.

Commit 1 dag geleden ★ 3.981
51 4/5 gemeten

wexflow

@aelassas

Workflow Automation Engine

MIT Commit 6 dagen geleden ★ 842
51 5/5 gemeten

awesome-etl

@pawl

A curated list of awesome ETL frameworks, libraries, and software.

CC0-1.0 Commit 5 maanden geleden ★ 3.593
50 5/5 gemeten

SDM-RDFizer

@SDM-TIB

An Efficient RML-Compliant Engine for Knowledge Graph Construction

Maintainer in de EU Apache-2.0 Commit 1 dag geleden ★ 139
50 5/5 gemeten

cnpj-data-pipeline

@caiopizzol

Pipeline open-source que baixa e processa os dados da Receita Federal para PostgreSQL

Commit 18 dagen geleden ★ 310
48 4/5 gemeten

quilt

@quiltdata

Quilt is a Scientific Data Management Platform on AWS that helps teams and AI find, trust, and reuse data through deeply versioned, context-rich data packages.

Apache-2.0 Commit vandaag ★ 1.370
48 5/5 gemeten

awesome-node-based-uis

@xyflow

A curated list with resources about node-based UIs

Maintainer in de EU CC0-1.0 Commit 1 jaar geleden ★ 3.684
47 4/5 gemeten

dataengineering-roadmap

@natayadev

Un repositorio más con conceptos básicos, desafíos técnicos y recursos sobre ingeniería de datos en español 🧙✨

MIT Commit 7 maanden geleden ★ 898
47 4/5 gemeten

paperetl

@neuml

📄 ⚙️ ETL processes for medical and scientific papers

Apache-2.0 Commit 10 maanden geleden ★ 697
46 5/5 gemeten

public-datasets-pipelines

@GoogleCloudPlatform

Cloud-native, data onboarding architecture for Google Cloud Datasets

Apache-2.0 Commit 3 maanden geleden ★ 180
46 5/5 gemeten

amphi-etl

@amphi-ai

visual data prep powered by python

Commit 1 maand geleden ★ 1.410
46 4/5 gemeten

flow

@estuary

🌊 Continuously synchronize the systems where your data lives, to the systems where you _want_ it to live, by managing your data flows with Estuary. 🌊

Commit 1 dag geleden ★ 979
46 5/5 gemeten

ChoETL

@Cinchoo

ETL framework for .NET (Parser / Writer for CSV, Flat, Xml, JSON, Key-Value, Parquet, Yaml, Avro formatted files)

MIT Commit 3 maanden geleden ★ 860
45 5/5 gemeten

dataforge

@Nuclear-Marmalade

Free open-source business data enrichment engine. The open-source alternative to Apollo, ZoomInfo, and Clearbit.

MIT Commit 6 maanden geleden ★ 55
45 4/5 gemeten

gusty

@pipeline-tools

Making DAG construction easier

MIT Commit 2 maanden geleden ★ 286
44 4/5 gemeten

go-streams

@reugn

A lightweight stream processing library for Go

MIT Commit 9 maanden geleden ★ 2.173
43 5/5 gemeten

pglogical

@2ndQuadrant

Logical Replication extension for PostgreSQL 17, 16, 15, 14, 13, 12, 11, 10, 9.6, 9.5, 9.4 (Postgres), providing much faster replication than Slony, Bucardo or Londiste, as well as cross-version upgrades.

Commit 2 maanden geleden ★ 1.239
43 5/5 gemeten

kuwala

@kuwala-io

Kuwala is the no-code data platform for BI analysts and engineers enabling you to build powerful analytics workflows. We are set out to bring state-of-the-art data engineering tools you love, such as Airbyte, dbt, or Great Expectations together in one intuitive interface built with React Flow. In addition we provide third-party data into data science models and products with a focus on geospatial data. Currently, the following data connectors are available worldwide: a) High-resolution demographics data b) Point of Interests from Open Street Map c) Google Popular Times

Maintainer in de EU Apache-2.0 Commit 4 jaaren geleden ★ 809
41 4/5 gemeten

koop

@koopjs

Transform, query, and download geospatial data on the web.

Commit 6 maanden geleden ★ 713
41 5/5 gemeten

qData

@qiantongtech

qData is an open-source data governance and data development platform that integrates ETL, data development, metadata management, data quality, data assets, API services, and AI-powered data Q&A.

Commit 2 dagen geleden ★ 609
41 4/5 gemeten

seatunnel-web

@apache

SeaTunnel is a distributed, high-performance data integration platform for the synchronization and transformation of massive data (offline & real-time).

Apache-2.0 Commit 8 maanden geleden ★ 883
40 4/5 gemeten

complete-dbt-bootcamp-zero-to-hero

@zoltanctoth

Supplementary Materials for the The Complete dbt (Data Build Tool) Bootcamp Udemy course

Maintainer in de EU Commit 3 dagen geleden ★ 831
40 4/5 gemeten

awesome-data-catalogs

@opendatadiscovery

📙 Awesome Data Catalogs and Observability Platforms.

MIT Commit 1 jaar geleden ★ 1.076
39 4/5 gemeten

practical-data-engineering

@ssp-data

Practical Data Engineering: A Hands-On Real-Estate Project Guide

Commit 3 maanden geleden ★ 826
39 4/5 gemeten

goodreads_etl_pipeline

@san089

An end-to-end GoodReads Data Pipeline for Building Data Lake, Data Warehouse and Analytics Platform.

MIT Commit 7 jaaren geleden ★ 1.545
37 4/5 gemeten

kiba

@thbar

Data processing & ETL framework for Ruby

Maintainer in de EU Commit 9 maanden geleden ★ 1.775
37 5/5 gemeten

monstache

@rwynn

a go daemon that syncs MongoDB to Elasticsearch in realtime. you know, for search.

MIT Commit 1 jaar geleden ★ 1.332
37 5/5 gemeten

memphis

@superstreamlabs

Memphis.dev is a highly scalable and effortless data streaming platform

Commit 7 maanden geleden ★ 3.445
35 4/5 gemeten

DataEngineeringProject

@damklis

Example end to end data engineering project.

Maintainer in de EU MIT Commit 4 jaaren geleden ★ 1.434
34 4/5 gemeten

mara-pipelines

@mara

A lightweight opinionated ETL framework, halfway between plain scripts and Apache Airflow

Maintainer in de EU MIT Commit 3 jaaren geleden ★ 2.091
32 5/5 gemeten

omniparser

@jf-tech

omniparser: a native Golang ETL streaming parser and transform library for CSV, JSON, XML, EDI, text, etc.

MIT Commit 2 jaaren geleden ★ 1.088
32 5/5 gemeten

flock

@flock-lab

Flock: A Low-Cost Streaming Query Engine on FaaS Platforms

AGPL-3.0 Commit 3 jaaren geleden ★ 285
32 4/5 gemeten

pyper

@pyper-dev

Concurrent Python made simple

MIT Commit 2 jaaren geleden ★ 1.518
31 4/5 gemeten

getting-started

@singer-io

This repository is a getting started guide to Singer.

Commit 1 jaar geleden ★ 1.350
30 5/5 gemeten

yobulkdev

@yobulkdev

🔥 🔥 🔥Open Source & AI driven Data Onboarding Platform:Free flatfile.com alternative

AGPL-3.0 Commit 3 jaaren geleden ★ 912
30 4/5 gemeten

klio

@spotify

Smarter data pipelines for audio.

Maintainer in de EU Apache-2.0 Commit 3 jaaren geleden ★ 876
30 5/5 gemeten

awesome-opensource-data-engineering

@gunnarmorling

An Awesome List of Open-Source Data Engineering Projects

Maintainer in de EU Commit 2 jaaren geleden ★ 3.296
26 4/5 gemeten

mycelial

@mycelial

Move your data with ease.

Apache-2.0 Commit 2 jaaren geleden ★ 117
24 4/5 gemeten

data-engineer-roadmap

@datastacktv

Roadmap to becoming a data engineer in 2021

Commit 5 jaaren geleden ★ 12.755
24 4/5 gemeten

active_workflow

@automaticmode

Polyglot workflows without leaving the comfort of your technology stack.

Zelf te hosten Commit 3 jaaren geleden ★ 864
24 4/5 gemeten

sync-addons

@itpp-labs

**Sync 🪬 Studio**

Commit 2 jaaren geleden ★ 155
20 4/5 gemeten

Data-Engineering-HowTo

@adilkhash

A list of useful resources to learn Data Engineering from scratch

Commit 2 jaaren geleden ★ 4.020
20 4/5 gemeten

streamify

@ankurchavda

A data engineering project with Kafka, Spark Streaming, dbt, Docker, Airflow, Terraform, GCP and much more!

Commit 4 jaaren geleden ★ 918
12 4/5 gemeten

data-engineering-book

@oleg-agapov

Accumulated knowledge and experience in the field of Data Engineering

Commit 4 jaaren geleden ★ 872
11 4/5 gemeten

open-data-etl-utility-kit

@Chicago

Use Pentaho's open source data integration tool (Kettle) to create Extract-Transform-Load (ETL) processes to update a Socrata open data portal. Documentation is available at http://open-data-etl-utility-kit.readthedocs.io/en/stable

Commit 10 jaaren geleden ★ 95
8 4/5 gemeten

RedditDataEngineering

@airscholar

This project provides a comprehensive data pipeline solution to extract, transform, and load (ETL) Reddit data into a Redshift data warehouse. The pipeline leverages a combination of tools and services including Apache Airflow, Celery, PostgreSQL, Amazon S3, AWS Glue, Amazon Athena, and Amazon Redshift.

Commit 3 jaaren geleden ★ 228
8 4/5 gemeten