DBScholar

Back to papers

TokenJoin: Efficient Filtering for Set Similarity Join with Maximum Weighted Bipartite Matching

Summary: TokenJoin: token-based filtering for fuzzy set similarity joins that use maximum-weight bipartite matching, replacing expensive element-pair similarity checks with cheaper token comparisons. Supports top-k and early termination, achieving up to an order-of-magnitude speedup vs. state-of-the-art element-based filters. (summarized by gpt-5-mini on Feb 09 2026)

Paper ID
13520
Venue
VLDB
Year
2023
Pagerank
5.093636e-05
Overall Rank
11,504 | 21.08%
DOI
10.14778/3574245.3574263

Incoming Non-self Citations Over Time

No non-self incoming citations found for this paper in this database.

Authors

BibTeX Citation

@article{zeakis_vldb23,
        title = {{TokenJoin: Efficient Filtering for Set Similarity Join with Maximum Weighted Bipartite Matching}},
        author = {Zeakis, Alexandros and Skoutas, Dimitrios and Sacharidis, Dimitris and Papapetrou, Odysseas and Koubarakis, Manolis},
        journal = {PVLDB},
        series = {{VLDB} '23},
        volume = {16},
        number = {4},
        pages = {790--802},
        doi = {10.14778/3574245.3574263},
        url = {https://doi.org/10.14778/3574245.3574263},
        year = {2023}
}

Incoming Citations (Sorted by Pagerank)

Showing 0 of 0 citing papers.

Rank Citing Paper Year Venue Pagerank
Previous Page 1 / 1 Next

Outgoing Citations (Sorted by Pagerank)

Showing 16 of 16 cited papers.

Citations counted here include only citations to other VLDB/SIGMOD/CIDR/PODS papers in this database.

Rank Cited Paper Year Venue Pagerank
107 Approximate String Joins in a Database (Almost) for Free 2001 VLDB 0.00033511706
169 Efficient Exact Set-Similarity Joins 2006 VLDB 0.0002743469
200 Efficient set joins on similarity predicates 2004 SIGMOD 0.00025597287
779 JOSIE: Overlap Set Similarity Search for Finding Joinable Tables in Data Lakes 2019 SIGMOD 0.00014092047
911 Ed-Join: An Efficient Algorithm for Similarity Joins With Edit Distance Constraints 2008 VLDB 0.00013283031
975 Can We Beat the Prefix Filtering? An Adaptive Framework for Similarity Join and Search 2012 SIGMOD 0.00012870645
991 Bayesian Locality Sensitive Hashing for Fast Similarity Search 2012 VLDB 0.00012793339
1,935 ATLAS: A Probabilistic Algorithm for High Dimensional Similarity Search 2011 SIGMOD 9.4560124e-05
2,036 Bed-Tree: An All-Purpose Index Structure for String Similarity Search Based on Edit Distance 2010 SIGMOD 9.2782094e-05
2,186 String Similarity Joins: An Experimental Evaluation 2014 VLDB 9.0001436e-05
2,501 An Empirical Evaluation of Set Similarity Join Techniques 2016 VLDB 8.4975661e-05
3,040 Leveraging Set Relations in Exact Set Similarity Join 2017 VLDB 7.8262287e-05
3,041 Spatio-Textual Similarity Joins 2013 VLDB 7.8254399e-05
3,193 Efficient Exact Edit Similarity Query Processing with the Asymmetric Signature Scheme 2011 SIGMOD 7.649474e-05
4,260 Set Similarity Joins on MapReduce: An Experimental Survey 2018 VLDB 6.7984322e-05
4,707 SILKMOTH: An Efficient Method for Finding Related Sets with Maximum Matching Constraints 2017 VLDB 6.552423e-05
Previous Page 1 / 1 Next

Semantically Similar Papers