DBScholar

Back to papers

CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning

Summary: CleanM unifies diverse data-cleaning operations in an optimizable language, translated across three abstraction levels for systematic optimization. Deployed on heterogeneous-data CleanDB, it provides a single query/cleaning interface with scalable, scale-out execution. (summarized by gpt-5.6-luna on Jul 24 2026)

Paper ID
h2d28029def3ef9a5
Venue
VLDB
Year
2017
Pagerank
5.5584215e-05
Overall Rank
7,302 | 50.93%
DOI
10.14778/3137628.3137654
PDF
Download (CC BY-NC-ND 4.0)

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{giannakopoulou_vldb17,
        title = {{CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning}},
        author = {Giannakopoulou, Stella and Karpathiotakis, Manos and Gaidioz, Benjamin and Ailamaki, Anastasia},
        journal = {PVLDB},
        series = {{VLDB} '17},
        volume = {10},
        number = {11},
        doi = {10.14778/3137628.3137654},
        url = {https://doi.org/10.14778/3137628.3137654},
        year = {2017}
}

Incoming Citations (Sorted by Pagerank)

Showing 4 of 4 citing papers.

Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 22 of 22 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
23 Spark SQL: Relational Data Processing in Spark 2015 SIGMOD 0.00055384955
95 Potter's Wheel: An Interactive Data Cleaning System 2001 VLDB 0.00034367518
154 MAD Skills: New Analysis Practices for Big Data 2009 VLDB 0.00028568843
262 Record Linkage: Similarity Measures and Algorithms 2006 SIGMOD 0.00022811258
514 Data Curation at Scale: The Data Tamer System 2013 CIDR 0.00016999652
697 NADEEF: A Commodity Data Cleaning System 2013 SIGMOD 0.00014687805
866 Processing Theta-Joins using MapReduce* 2011 SIGMOD 0.00013381756
1,070 NoDB: Efficient Query Execution on Raw Data Files 2012 SIGMOD 0.00012179575
1,633 Summingbird: A Framework for Integrating Batch and Online MapReduce Computations 2014 VLDB 0.00010015001
1,722 A Sample-and-Clean Framework for Fast and Accurate Query Processing on Dirty Data 2014 SIGMOD 9.7921604e-05
1,915 Statistical Distortion: Consequences of Data Cleaning 2012 VLDB 9.3841217e-05
2,072 Dedoop: Efficient Deduplication with Hadoop 2012 VLDB 9.0834235e-05
2,223 String Similarity Joins: An Experimental Evaluation 2014 VLDB 8.8105347e-05
2,424 BigDansing: A System for Big Data Cleansing 2015 SIGMOD 8.483813e-05
2,577 ClusterJoin: A Similarity Joins Framework using Map-Reduce 2014 VLDB 8.2699584e-05
3,071 Adaptive Query Processing on RAW Data 2014 VLDB 7.6789108e-05
3,505 Fast Queries Over Heterogeneous Data Through Engine Customization 2016 VLDB 7.2474175e-05
4,863 That's All Folks! LLUNATIC Goes Open Source 2014 VLDB 6.3757278e-05
5,199 QuERy: A Framework for Integrating Entity Resolution with Query Processing 2016 VLDB 6.2309669e-05
5,515 KATARA: Reliable Data Cleaning with Knowledge Bases and Crowdsourcing 2015 VLDB 6.0962265e-05
6,281 Just-In-Time Data Virtualization: Lightweight Data Management with ViDa 2015 CIDR 5.8236382e-05
8,785 Wisteria: Nurturing Scalable Data Cleaning Infrastructure 2015 VLDB 5.2767488e-05
Previous Page 1 / 1 Next

Semantically Similar Papers