DBScholar

Back to papers

Balance-Aware Distributed String Similarity-Based Query Processing System

Summary: Dima: distributed in-memory Spark system for similarity queries; supports similarity select, join, and top-k. Balance-aware signatures with global/local indexes balance load and accelerate queries; four real datasets show 1–3 orders of magnitude speedups. (summarized by gpt-5-nano on Feb 09 2026)

Paper ID
12206
Venue
VLDB
Year
2019
Pagerank
5.1845938e-05
Overall Rank
9,979 | 31.54%
DOI
10.14778/3329772.3329774

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{sun_vldb19,
        title = {{Balance-Aware Distributed String Similarity-Based Query Processing System}},
        author = {Sun, Ji and Shang, Zeyuan and Li, Guoliang and Deng, Dong and Bao, Zhifeng},
        journal = {PVLDB},
        series = {{VLDB} '19},
        volume = {12},
        number = {9},
        pages = {961--974},
        doi = {10.14778/3329772.3329774},
        url = {https://doi.org/10.14778/3329772.3329774},
        year = {2019}
}

Incoming Citations (Sorted by Pagerank)

Showing 2 of 2 citing papers.

Rank Citing Paper Year Venue Pagerank
4,617 Learned Cardinality Estimation for Similarity Queries 2021 SIGMOD 6.604437e-05
10,951 Extensible and Robust Evaluation of Similarity Queries 2025 VLDB 5.093636e-05
Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 23 of 23 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
107 Approximate String Joins in a Database (Almost) for Free 2001 VLDB 0.00033511706
158 Robust and Efficient Fuzzy Match for Online Data Cleaning 2003 SIGMOD 0.00028199923
169 Efficient Exact Set-Similarity Joins 2006 VLDB 0.0002743469
200 Efficient set joins on similarity predicates 2004 SIGMOD 0.00025597287
356 Efficient Parallel Set-Similarity Joins Using MapReduce 2010 SIGMOD 0.00020303289
529 Magellan: Toward Building Entity Matching Management Systems 2016 VLDB 0.00017096361
911 Ed-Join: An Efficient Algorithm for Similarity Joins With Edit Distance Constraints 2008 VLDB 0.00013283031
975 Can We Beat the Prefix Filtering? An Adaptive Framework for Similarity Join and Search 2012 SIGMOD 0.00012870645
991 Bayesian Locality Sensitive Hashing for Fast Similarity Search 2012 VLDB 0.00012793339
1,040 VGRAM: Improving Performance of Approximate Queries on String Collections Using Variable-Length Grams 2007 VLDB 0.00012466499
1,415 V-SMART-Join: A Scalable MapReduce Framework for All-Pair Similarity Joins of Multisets and Vectors 2012 VLDB 0.00010840141
1,643 Falcon: Scaling Up Hands-Off Crowdsourced Entity Matching to Build Cloud Services 2017 SIGMOD 0.00010134956
1,886 Pass-Join: A Partition-based Method for Similarity Joins 2012 VLDB 9.5358137e-05
1,935 ATLAS: A Probabilistic Algorithm for High Dimensional Similarity Search 2011 SIGMOD 9.4560124e-05
2,036 Bed-Tree: An All-Purpose Index Structure for String Similarity Search Based on Edit Distance 2010 SIGMOD 9.2782094e-05
2,186 String Similarity Joins: An Experimental Evaluation 2014 VLDB 9.0001436e-05
3,474 An Efficient Partition Based Method for Exact Set Similarity Joins 2016 VLDB 7.3859271e-05
3,724 Overlap Set Similarity Joins with Theoretical Guarantees 2018 SIGMOD 7.1715735e-05
4,359 Incremental Maintenance of Length Normalized Indexes for Approximate String Matching 2009 SIGMOD 6.7451753e-05
6,290 Dima: A Distributed In-Memory Similarity-Based Query Processing System 2017 VLDB 5.9253163e-05
6,484 A Pivotal Prefix Based Filtering Algorithm for String Similarity Search 2014 SIGMOD 5.8665833e-05
6,906 Efficient Similarity Join and Search on Multi-Attribute Data 2015 SIGMOD 5.7418509e-05
7,575 Scalable Column Concept Determination for Web Tables Using Large Knowledge Bases 2013 VLDB 5.5937684e-05
Previous Page 1 / 1 Next

Semantically Similar Papers