An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

0 stars 0 forks 0 watchers Python Apache License 2.0
datasets etl machine-learning mlops nlp parquet reproducibility wikipedia
6 Open Issues Need Help Last updated: Aug 21, 2026

Open Issues Need Help

View All on GitHub
enhancement help wanted github-actions benchmark

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia
enhancement help wanted python

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia
help wanted extraction benchmark

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia
enhancement help wanted benchmark

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia
documentation help wanted needs-review

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia
help wanted needs-review extraction

An auditable Wikimedia-to-ML data pipeline with deterministic splits, Parquet, token shards, manifests, and validation.

Python
#datasets#etl#machine-learning#mlops#nlp#parquet#reproducibility#wikipedia