2025-08-03 - 2026-08-03
Overview
5 Pull requests merged by 2 users
Merged
#44 feat: add streaming of rdf xml dataset with resume functionality
Merged
#47 sdcum15rrc-aider
Merged
#42 fix: fix path too long issue; fix pickling issue in unified converter script
Merged
#41 fix: complete the unified script to add add the new features as streaming parallel; update the upload_all_dataset.py to use the unified script
Merged
#1 Initial checkin for scripts.
7 Pull requests proposed by 2 users
Proposed
#45 stream-download-convert-upload-merge-15-refactor-rdf-converters
Proposed
#46 auto-excel-update
Proposed
#48 unit-tests-google-tracker-sheet
Proposed
#49 xml-streaming-optimization
Proposed
#53 Docker: add entrypoint script for upload single dataset
Proposed
#56 Create-validator.
Proposed
#61 Attempt to always run tests.
1 Issue closed from 1 user
Closed
#60 wikidata is returning 404 error.
32 Issues created by 2 users
Opened
#3 Fix all pyright errors.
Opened
#4 Fix all ruff check errors.
Opened
#5 Convert code to a proper Python app.
Opened
#6 Create tests for all parts of the program
Opened
#7 Integrate the code with Docker
Opened
#8 Integrate the code with dev containers.
Opened
#9 Integrate the code with Forgejo's build system
Opened
#10 Integrate the code with uv as the package selection system.
Opened
#11 Write documentation for the dataset uploader.
Opened
#12 Final cleanup.
Opened
#13 Implement missing modulels
Opened
#14 Create proper CLI entry points.
Opened
#15 Refactor 5 RDF converter scripts to unified strategy pattern
Opened
#16 Add proper error messages and logging.
Opened
#18 The --rm parameter should remove cached files.
Opened
#19 Rewrite upload_all_datasets with more clarity and fewer bugs.
Opened
#20 Fix upload_all_datasets.2.py: streaming converter, default behavior, and dry-run mode
Opened
#26 Command-line option to turn off convert step
Opened
#27 Allow download via ftp.
Opened
#30 How are temporary files used?
Opened
#32 Fix download resume functionality in rdf_dataset_downloader.py
Opened
#35 Add xz decompression
Opened
#36 Add multiple files to the dataset_config.
Opened
#50 Implement Streaming Pipeline for Large RDF Datasets
Opened
#51 Integrate Google Sheets for Dataset Processing Status Tracking
Opened
#52 Optimize RDF Streaming with Description Skipping and Parallel Parsing
Opened
#54 CleverDatasets does not handle dates before 1 AD.
Opened
#55 CleverDatasets needs a way to override Skipping... Already exists on.
Opened
#57 Add Retry Logic for HuggingFace Transient Errors
Opened
#58 Implement RDF/XML streaming functionality for robust large-scale dataset processing
Opened
#59 DevContainer setup for VS Code and PyCharm - zero-configuration dataset upload environment
Opened
#60 wikidata is returning 404 error.