DBScholar

Back to papers

CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning

Summary: CleanM unifies diverse data-cleaning operations in an optimizable language, translated across three abstraction levels for systematic optimization. Deployed on heterogeneous-data CleanDB, it provides a single query/cleaning interface with scalable, scale-out execution. (summarized by gpt-5.6-luna on Jul 24 2026)

Paper ID
11619
Venue
VLDB
Year
2017
Pagerank
5.6802479e-05
Overall Rank
7,179 | 50.75%
DOI
10.14778/3137628.3137654

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{giannakopoulou_vldb17,
        title = {{CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning}},
        author = {Giannakopoulou, Stella and Karpathiotakis, Manos and Gaidioz, Benjamin and Ailamaki, Anastasia},
        journal = {PVLDB},
        series = {{VLDB} '17},
        volume = {10},
        number = {11},
        doi = {10.14778/3137628.3137654},
        url = {https://doi.org/10.14778/3137628.3137654},
        year = {2017}
}

Incoming Citations (Sorted by Pagerank)

Showing 4 of 4 citing papers.

Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 22 of 22 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
24 Spark SQL: Relational Data Processing in Spark 2015 SIGMOD 0.00054865648
94 Potter's Wheel: An Interactive Data Cleaning System 2001 VLDB 0.00034616103
155 MAD Skills: New Analysis Practices for Big Data 2009 VLDB 0.00028713176
254 Record Linkage: Similarity Measures and Algorithms 2006 SIGMOD 0.00023199211
516 Data Curation at Scale: The Data Tamer System 2013 CIDR 0.00017171198
725 NADEEF: A Commodity Data Cleaning System 2013 SIGMOD 0.00014617251
843 Processing Theta-Joins using MapReduce* 2011 SIGMOD 0.00013666161
1,070 NoDB: Efficient Query Execution on Raw Data Files 2012 SIGMOD 0.0001232307
1,639 Summingbird: A Framework for Integrating Batch and Online MapReduce Computations 2014 VLDB 0.00010155021
1,736 A Sample-and-Clean Framework for Fast and Accurate Query Processing on Dirty Data 2014 SIGMOD 9.8984415e-05
1,914 Statistical Distortion: Consequences of Data Cleaning 2012 VLDB 9.4886927e-05
2,055 Dedoop: Efficient Deduplication with Hadoop 2012 VLDB 9.2512023e-05
2,186 String Similarity Joins: An Experimental Evaluation 2014 VLDB 9.0001436e-05
2,398 BigDansing: A System for Big Data Cleansing 2015 SIGMOD 8.631172e-05
2,567 ClusterJoin: A Similarity Joins Framework using Map-Reduce 2014 VLDB 8.4098241e-05
3,062 Adaptive Query Processing on RAW Data 2014 VLDB 7.8037446e-05
3,638 Fast Queries Over Heterogeneous Data Through Engine Customization 2016 VLDB 7.2338361e-05
4,750 That's All Folks! LLUNATIC Goes Open Source 2014 VLDB 6.5247192e-05
5,204 QuERy: A Framework for Integrating Entity Resolution with Query Processing 2016 VLDB 6.3187983e-05
5,397 KATARA: Reliable Data Cleaning with Knowledge Bases and Crowdsourcing 2015 VLDB 6.232136e-05
6,181 Just-In-Time Data Virtualization: Lightweight Data Management with ViDa 2015 CIDR 5.9494838e-05
8,620 Wisteria: Nurturing Scalable Data Cleaning Infrastructure 2015 VLDB 5.3991092e-05
Previous Page 1 / 1 Next

Semantically Similar Papers