DBScholar

Back to papers

Balance-Aware Distributed String Similarity-Based Query Processing System

Summary: Dima: distributed in-memory Spark system for similarity queries; supports similarity select, join, and top-k. Balance-aware signatures with global/local indexes balance load and accelerate queries; four real datasets show 1–3 orders of magnitude speedups. (summarized by gpt-5-nano on Feb 09 2026)

Paper ID
h8cbb588f9340611d
Venue
VLDB
Year
2019
Pagerank
5.22387e-05
Overall Rank
9,126 | 38.65%
DOI
10.14778/3329772.3329774

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{sun_vldb19,
        title = {{Balance-Aware Distributed String Similarity-Based Query Processing System}},
        author = {Sun, Ji and Shang, Zeyuan and Li, Guoliang and Deng, Dong and Bao, Zhifeng},
        journal = {PVLDB},
        series = {{VLDB} '19},
        volume = {12},
        number = {9},
        pages = {961--974},
        doi = {10.14778/3329772.3329774},
        url = {https://doi.org/10.14778/3329772.3329774},
        year = {2019}
}

Incoming Citations (Sorted by Pagerank)

Showing 3 of 3 citing papers.

Rank Citing Paper Year Venue Pagerank
4,688 Learned Cardinality Estimation for Similarity Queries 2021 SIGMOD 6.4697463e-05
10,859 Pail: Efficient kNN Search on Set-Valued Attributes 2026 VLDB 4.9793485e-05
11,339 Extensible and Robust Evaluation of Similarity Queries 2025 VLDB 4.9793485e-05
Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 23 of 23 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
108 Approximate String Joins in a Database (Almost) for Free 2001 VLDB 0.0003305531
161 Robust and Efficient Fuzzy Match for Online Data Cleaning 2003 SIGMOD 0.00027718195
168 Efficient Exact Set-Similarity Joins 2006 VLDB 0.00027163517
201 Efficient set joins on similarity predicates 2004 SIGMOD 0.00025331535
360 Efficient Parallel Set-Similarity Joins Using MapReduce 2010 SIGMOD 0.00020009936
530 Magellan: Toward Building Entity Matching Management Systems 2016 VLDB 0.00016855162
929 Ed-Join: An Efficient Algorithm for Similarity Joins With Edit Distance Constraints 2008 VLDB 0.00013020115
963 Can We Beat the Prefix Filtering? An Adaptive Framework for Similarity Join and Search 2012 SIGMOD 0.00012816649
992 Bayesian Locality Sensitive Hashing for Fast Similarity Search 2012 VLDB 0.00012646771
1,061 VGRAM: Improving Performance of Approximate Queries on String Collections Using Variable-Length Grams 2007 VLDB 0.00012213729
1,421 V-SMART-Join: A Scalable MapReduce Framework for All-Pair Similarity Joins of Multisets and Vectors 2012 VLDB 0.00010726757
1,654 Falcon: Scaling Up Hands-Off Crowdsourced Entity Matching to Build Cloud Services 2017 SIGMOD 9.9739611e-05
1,923 ATLAS: A Probabilistic Algorithm for High Dimensional Similarity Search 2011 SIGMOD 9.3750526e-05
1,933 Pass-Join: A Partition-based Method for Similarity Joins 2012 VLDB 9.3459285e-05
2,072 Bed-Tree: An All-Purpose Index Structure for String Similarity Search Based on Edit Distance 2010 SIGMOD 9.0864612e-05
2,220 String Similarity Joins: An Experimental Evaluation 2014 VLDB 8.8146984e-05
3,350 An Efficient Partition Based Method for Exact Set Similarity Joins 2016 VLDB 7.3910669e-05
3,596 Overlap Set Similarity Joins with Theoretical Guarantees 2018 SIGMOD 7.1790375e-05
4,439 Incremental Maintenance of Length Normalized Indexes for Approximate String Matching 2009 SIGMOD 6.5998035e-05
5,912 Dima: A Distributed In-Memory Similarity-Based Query Processing System 2017 VLDB 5.9501002e-05
6,605 A Pivotal Prefix Based Filtering Algorithm for String Similarity Search 2014 SIGMOD 5.7367357e-05
7,030 Efficient Similarity Join and Search on Multi-Attribute Data 2015 SIGMOD 5.6173605e-05
7,709 Scalable Column Concept Determination for Web Tables Using Large Knowledge Bases 2013 VLDB 5.4717883e-05
Previous Page 1 / 1 Next

Semantically Similar Papers