DBScholar

Back to papers

CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning

Summary: CleanM unifies diverse data-cleaning operations in an optimizable language, translated across three abstraction levels for systematic optimization. Deployed on heterogeneous-data CleanDB, it provides a single query/cleaning interface with scalable, scale-out execution. (summarized by gpt-5.6-luna on Jul 24 2026)

Paper ID
h2d28029def3ef9a5
Venue
VLDB
Year
2017
Pagerank
5.561054e-05
Overall Rank
7,298 | 50.94%
DOI
10.14778/3137628.3137654

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{giannakopoulou_vldb17,
        title = {{CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning}},
        author = {Giannakopoulou, Stella and Karpathiotakis, Manos and Gaidioz, Benjamin and Ailamaki, Anastasia},
        journal = {PVLDB},
        series = {{VLDB} '17},
        volume = {10},
        number = {11},
        doi = {10.14778/3137628.3137654},
        url = {https://doi.org/10.14778/3137628.3137654},
        year = {2017}
}

Incoming Citations (Sorted by Pagerank)

Showing 4 of 4 citing papers.

Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 22 of 22 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
23 Spark SQL: Relational Data Processing in Spark 2015 SIGMOD 0.00055406774
95 Potter's Wheel: An Interactive Data Cleaning System 2001 VLDB 0.00034382643
154 MAD Skills: New Analysis Practices for Big Data 2009 VLDB 0.00028579704
262 Record Linkage: Similarity Measures and Algorithms 2006 SIGMOD 0.00022821392
514 Data Curation at Scale: The Data Tamer System 2013 CIDR 0.00017006745
697 NADEEF: A Commodity Data Cleaning System 2013 SIGMOD 0.00014694048
865 Processing Theta-Joins using MapReduce* 2011 SIGMOD 0.0001338765
1,069 NoDB: Efficient Query Execution on Raw Data Files 2012 SIGMOD 0.00012185253
1,633 Summingbird: A Framework for Integrating Batch and Online MapReduce Computations 2014 VLDB 0.00010019617
1,720 A Sample-and-Clean Framework for Fast and Accurate Query Processing on Dirty Data 2014 SIGMOD 9.7965659e-05
1,914 Statistical Distortion: Consequences of Data Cleaning 2012 VLDB 9.3878613e-05
2,070 Dedoop: Efficient Deduplication with Hadoop 2012 VLDB 9.0876046e-05
2,220 String Similarity Joins: An Experimental Evaluation 2014 VLDB 8.8146984e-05
2,423 BigDansing: A System for Big Data Cleansing 2015 SIGMOD 8.4877894e-05
2,577 ClusterJoin: A Similarity Joins Framework using Map-Reduce 2014 VLDB 8.2738285e-05
3,069 Adaptive Query Processing on RAW Data 2014 VLDB 7.6822697e-05
3,505 Fast Queries Over Heterogeneous Data Through Engine Customization 2016 VLDB 7.2508161e-05
4,861 That's All Folks! LLUNATIC Goes Open Source 2014 VLDB 6.3787474e-05
5,198 QuERy: A Framework for Integrating Entity Resolution with Query Processing 2016 VLDB 6.2338998e-05
5,512 KATARA: Reliable Data Cleaning with Knowledge Bases and Crowdsourcing 2015 VLDB 6.0991137e-05
6,278 Just-In-Time Data Virtualization: Lightweight Data Management with ViDa 2015 CIDR 5.8263939e-05
8,777 Wisteria: Nurturing Scalable Data Cleaning Infrastructure 2015 VLDB 5.2792451e-05
Previous Page 1 / 1 Next

Semantically Similar Papers