DBScholar

Back to papers

Pass-Join: A Partition-based Method for Similarity Joins

Summary: Pass-Join adaptively handles edit-distance similarity joins over both short and long strings via partitioning, inverted indices, and provably minimal substring selection. Novel pruning accelerates candidate verification, outperforming prior methods on real datasets. (summarized by gpt-5.6-luna on Jul 24 2026)

Paper ID
10663
Venue
VLDB
Year
2012
Pagerank
9.5358137e-05
Overall Rank
1,886 | 87.07%
DOI
10.14778/2078331.2078340

Incoming Non-self Citations Over Time

Authors

BibTeX Citation

@article{li_vldb12,
        title = {{Pass-Join: A Partition-based Method for Similarity Joins}},
        author = {Li, Guoliang and Deng, Dong and Wang, Jiannan and Feng, Jianhua},
        journal = {PVLDB},
        series = {{VLDB} '12},
        volume = {5},
        number = {3},
        pages = {253--264},
        doi = {10.14778/2078331.2078340},
        url = {https://doi.org/10.14778/2078331.2078340},
        year = {2012}
}

Incoming Citations (Sorted by Pagerank)

Showing 39 of 39 citing papers.

Rank Citing Paper Year Venue Pagerank
779 JOSIE: Overlap Set Similarity Search for Finding Joinable Tables in Data Lakes 2019 SIGMOD 0.00014092047
975 Can We Beat the Prefix Filtering? An Adaptive Framework for Similarity Join and Search 2012 SIGMOD 0.00012870645
2,010 iDEC: Indexable Distance Estimating Codes for Approximate Nearest Neighbor Search 2020 VLDB 9.3085202e-05
2,186 String Similarity Joins: An Experimental Evaluation 2014 VLDB 9.0001436e-05
3,474 An Efficient Partition Based Method for Exact Set Similarity Joins 2016 VLDB 7.3859271e-05
3,724 Overlap Set Similarity Joins with Theoretical Guarantees 2018 SIGMOD 7.1715735e-05
3,806 On the Complexity of Inner Product Similarity Join 2016 PODS 7.108802e-05
4,052 Local Similarity Search for Unstructured Text 2016 SIGMOD 6.935988e-05
4,260 Set Similarity Joins on MapReduce: An Experimental Survey 2018 VLDB 6.7984322e-05
4,396 Approximate String Joins with Abbreviations 2018 VLDB 6.7268636e-05
4,617 Learned Cardinality Estimation for Similarity Queries 2021 SIGMOD 6.604437e-05
4,707 SILKMOTH: An Efficient Method for Finding Related Sets with Maximum Matching Constraints 2017 VLDB 6.552423e-05
4,984 SEAL: Spatio-Textual Similarity Search 2012 VLDB 6.412239e-05
5,088 String Similarity Measures and Joins with Synonyms 2013 SIGMOD 6.3673276e-05
5,134 Auto-FuzzyJoin: Auto-Program Fuzzy Similarity Joins Without Labeled Examples 2021 SIGMOD 6.3532024e-05
5,726 Pigeonring: A Principle for Faster Thresholded Similarity Search 2019 VLDB 6.1079184e-05
5,996 The Communication Complexity of Distributed Set-Joins with Applications to Matrix Multiplication 2015 PODS 6.0150613e-05
6,014 Scaling Similarity Joins over Tree-Structured Data 2015 VLDB 6.0084322e-05
6,290 Dima: A Distributed In-Memory Similarity-Based Query Processing System 2017 VLDB 5.9253163e-05
6,484 A Pivotal Prefix Based Filtering Algorithm for String Similarity Search 2014 SIGMOD 5.8665833e-05
6,906 Efficient Similarity Join and Search on Multi-Attribute Data 2015 SIGMOD 5.7418509e-05
7,031 Efficient Error-tolerant Query Autocompletion 2013 VLDB 5.72252e-05
7,152 Boosting Graph Similarity Search through Pre-Computation 2021 SIGMOD 5.6872619e-05
7,476 SyncSignature: A Simple, Efficient, Parallelizable Framework for Tree Similarity Joins 2023 VLDB 5.6090634e-05
7,493 Human-in-the-loop Data Integration 2017 VLDB 5.6046905e-05
7,575 Scalable Column Concept Determination for Web Tables Using Large Knowledge Bases 2013 VLDB 5.5937684e-05
7,676 Allign: Aligning All-Pair Near-Duplicate Passages in Long Texts 2021 SIGMOD 5.5686107e-05
7,745 Near-Duplicate Text Alignment with One Permutation Hashing 2024 SIGMOD 5.5534781e-05
8,522 TxtAlign: Efficient Near-Duplicate Text Alignment Search via Bottom-k Sketches for Plagiarism Detection 2022 SIGMOD 5.4119882e-05
9,317 Set Similarity Search for Skewed Data 2018 PODS 5.289545e-05
9,705 META: An Efficient Matching-Based Method for Error-Tolerant Autocompletion 2016 VLDB 5.2351259e-05
9,979 Balance-Aware Distributed String Similarity-Based Query Processing System 2019 VLDB 5.1845938e-05
10,024 Near-Duplicate Sequence Search at Scale for Large Language Model Memorization Evaluation 2023 SIGMOD 5.1757914e-05
10,085 Local Filtering: Improving the Performance of Approximate Queries on String Collections 2015 SIGMOD 5.1559617e-05
10,086 Efficient and Effective KNN Sequence Search with Approximate n-grams 2014 VLDB 5.1559617e-05
10,951 Extensible and Robust Evaluation of Similarity Queries 2025 VLDB 5.093636e-05
11,149 Similarity Joins of Sparse Features 2024 SIGMOD 5.093636e-05
11,293 Dealing with Acronyms, Abbreviations, and Typos in Real-World Entity Matching 2024 VLDB 5.093636e-05
12,177 Similarity Joins for Uncertain Strings 2014 SIGMOD 5.093636e-05
Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 16 of 16 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
107 Approximate String Joins in a Database (Almost) for Free 2001 VLDB 0.00033511706
158 Robust and Efficient Fuzzy Match for Online Data Cleaning 2003 SIGMOD 0.00028199923
169 Efficient Exact Set-Similarity Joins 2006 VLDB 0.0002743469
200 Efficient set joins on similarity predicates 2004 SIGMOD 0.00025597287
356 Efficient Parallel Set-Similarity Joins Using MapReduce 2010 SIGMOD 0.00020303289
911 Ed-Join: An Efficient Algorithm for Similarity Joins With Edit Distance Constraints 2008 VLDB 0.00013283031
2,036 Bed-Tree: An All-Purpose Index Structure for String Similarity Search Based on Edit Distance 2010 SIGMOD 9.2782094e-05
2,308 Hashed Samples: Selectivity Estimators For Set Similarity Selection Queries 2008 VLDB 8.7738996e-05
2,899 Extending Q-Grams to Estimate Selectivity of String Matching with Low Edit Distance 2007 VLDB 7.97814e-05
3,442 An Efficient Filter for Approximate Membership Checking 2008 SIGMOD 7.4122197e-05
3,446 Efficient Approximate Entity Extraction with Edit Distance Constraints 2009 SIGMOD 7.4087786e-05
3,731 Trie-Join: Efficient Trie-based String Similarity Joins with Edit-Distance Constraints 2010 VLDB 7.1663952e-05
4,359 Incremental Maintenance of Length Normalized Indexes for Approximate String Matching 2009 SIGMOD 6.7451753e-05
4,450 Power-Law Based Estimation of Set Similarity Join Size 2009 VLDB 6.6972929e-05
4,992 Scalable Ad-hoc Entity Extraction from Text Collections 2008 VLDB 6.4100657e-05
5,412 Faerie: Efficient Filtering Algorithms for Approximate Dictionary-based Entity Extraction 2011 SIGMOD 6.2272563e-05
Previous Page 1 / 1 Next

Semantically Similar Papers