DBScholar

Back to papers

Balance-Aware Distributed String Similarity-Based Query Processing System

Summary: Dima: distributed in-memory Spark system for similarity queries; supports similarity select, join, and top-k. Balance-aware signatures with global/local indexes balance load and accelerate queries; four real datasets show 1–3 orders of magnitude speedups. (summarized by gpt-5-nano on Feb 09 2026)

Paper ID
h8cbb588f9340611d
Venue
VLDB
Year
2019
Pagerank
5.2213971e-05
Overall Rank
9,136 | 38.60%
DOI
10.14778/3329772.3329774
PDF
Download (CC BY-NC-ND 4.0)

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{sun_vldb19,
        title = {{Balance-Aware Distributed String Similarity-Based Query Processing System}},
        author = {Sun, Ji and Shang, Zeyuan and Li, Guoliang and Deng, Dong and Bao, Zhifeng},
        journal = {PVLDB},
        series = {{VLDB} '19},
        volume = {12},
        number = {9},
        pages = {961--974},
        doi = {10.14778/3329772.3329774},
        url = {https://doi.org/10.14778/3329772.3329774},
        year = {2019}
}

Incoming Citations (Sorted by Pagerank)

Showing 3 of 3 citing papers.

Rank Citing Paper Year Venue Pagerank
4,690 Learned Cardinality Estimation for Similarity Queries 2021 SIGMOD 6.4667478e-05
10,868 Pail: Efficient kNN Search on Set-Valued Attributes 2026 VLDB 4.9769913e-05
11,347 Extensible and Robust Evaluation of Similarity Queries 2025 VLDB 4.9769913e-05
Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 23 of 23 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
108 Approximate String Joins in a Database (Almost) for Free 2001 VLDB 0.00033040246
161 Robust and Efficient Fuzzy Match for Online Data Cleaning 2003 SIGMOD 0.00027705594
168 Efficient Exact Set-Similarity Joins 2006 VLDB 0.00027151132
201 Efficient set joins on similarity predicates 2004 SIGMOD 0.00025319937
360 Efficient Parallel Set-Similarity Joins Using MapReduce 2010 SIGMOD 0.00020001237
530 Magellan: Toward Building Entity Matching Management Systems 2016 VLDB 0.00016847532
929 Ed-Join: An Efficient Algorithm for Similarity Joins With Edit Distance Constraints 2008 VLDB 0.00013014029
965 Can We Beat the Prefix Filtering? An Adaptive Framework for Similarity Join and Search 2012 SIGMOD 0.00012810695
990 Bayesian Locality Sensitive Hashing for Fast Similarity Search 2012 VLDB 0.00012643446
1,062 VGRAM: Improving Performance of Approximate Queries on String Collections Using Variable-Length Grams 2007 VLDB 0.00012208031
1,421 V-SMART-Join: A Scalable MapReduce Framework for All-Pair Similarity Joins of Multisets and Vectors 2012 VLDB 0.00010722146
1,655 Falcon: Scaling Up Hands-Off Crowdsourced Entity Matching to Build Cloud Services 2017 SIGMOD 9.9694129e-05
1,922 ATLAS: A Probabilistic Algorithm for High Dimensional Similarity Search 2011 SIGMOD 9.3726231e-05
1,934 Pass-Join: A Partition-based Method for Similarity Joins 2012 VLDB 9.341845e-05
2,074 Bed-Tree: An All-Purpose Index Structure for String Similarity Search Based on Edit Distance 2010 SIGMOD 9.0821759e-05
2,223 String Similarity Joins: An Experimental Evaluation 2014 VLDB 8.8105347e-05
3,350 An Efficient Partition Based Method for Exact Set Similarity Joins 2016 VLDB 7.3875743e-05
3,598 Overlap Set Similarity Joins with Theoretical Guarantees 2018 SIGMOD 7.1756405e-05
4,441 Incremental Maintenance of Length Normalized Indexes for Approximate String Matching 2009 SIGMOD 6.5966903e-05
5,914 Dima: A Distributed In-Memory Similarity-Based Query Processing System 2017 VLDB 5.9472869e-05
6,608 A Pivotal Prefix Based Filtering Algorithm for String Similarity Search 2014 SIGMOD 5.73402e-05
7,032 Efficient Similarity Join and Search on Multi-Attribute Data 2015 SIGMOD 5.6147056e-05
7,716 Scalable Column Concept Determination for Web Tables Using Large Knowledge Bases 2013 VLDB 5.4692136e-05
Previous Page 1 / 1 Next

Semantically Similar Papers