{"doi":"10.1075/ijcl.3.1.06som","title":"Further Experiments in Bilingual Text Alignment","abstract":"<jats:p>We describe and experimentally evaluate an alternative algorithm for aligning and extracting vocabulary from parallel texts using recency vectors and a similarity measure based on Levenshtein distance. The work is largely inspired by Fung and McKeown 's DK-vec, though we use a simpler algorithm. The technique is tested on two sets of parallel corpora involving English, French, German, Dutch, Spanish, and Japanese. We attempt to evaluate the importance of parameters such as frequency of words chosen as candidates, the effect of different language pairings, and differences between the two corpora.</jats:p>","journal":"International Journal of Corpus Linguistics","year":1998,"id":605118,"datarank":0.40620753016533157,"base_score":2.70805020110221,"endowment":2.70805020110221,"self_citation_contribution":0.40620753016533157,"citation_network_contribution":0.0,"self_endowment_contribution":0.40620753016533157,"citer_contribution":0.0,"corpus_percentile":null,"corpus_rank":null,"citation_count":14,"citer_count":0,"citers_with_citation_signal":0,"citers_with_endowment":0,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":null,"is_data_producer":false,"deposit_databanks":null,"is_oa":false,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":null,"fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":1552936,"name":"Harold Somers","orcid":null,"position":0,"is_corresponding":false}],"reference_count":0,"raw_metadata":{"has_enrichment":true,"resolved":true,"title":"Further Experiments in Bilingual Text Alignment","abstract":"<jats:p>We describe and experimentally evaluate an alternative algorithm for aligning and extracting vocabulary from parallel texts using recency vectors and a similarity measure based on Levenshtein distance. The work is largely inspired by Fung and McKeown 's DK-vec, though we use a simpler algorithm. The technique is tested on two sets of parallel corpora involving English, French, German, Dutch, Spanish, and Japanese. We attempt to evaluate the importance of parameters such as frequency of words chosen as candidates, the effect of different language pairings, and differences between the two corpora.</jats:p>","is_dataset_classified":null,"base_score":2.70805020110221,"endowment":2.70805020110221,"datacite_reuse_total":0,"file_count":0,"downloads":0,"views":0,"has_version_chain":false,"is_dataset":false,"is_oa":false,"pmid":"23304386","pmcid":null,"openalex_id":"https://openalex.org/W1967312449","authors":[],"funders":[],"total_grants":0,"fwci":2.1848,"citation_percentile":0.88698757,"influential_citations":0,"citation_trend":[{"year":2012,"count":1},{"year":2014,"count":1},{"year":2021,"count":1}],"oa_status":"closed","license":null,"oa_locations":[{"url":"http://www.jbe-platform.com/deliver/fulltext/ijcl.3.1.06som.pdf","host_type":"publisher"},{"url":"https://doi.org/10.1075/ijcl.3.1.06som","host_type":"journal"}],"fields_of_study":["Natural Language Processing Techniques","Topic Modeling","Text and Document Classification Technologies"],"mesh_terms":[],"keywords":["Levenshtein distance","Computer science","Similarity (geometry)","Natural language processing","German","Artificial intelligence","Vocabulary","Measure (data warehouse)","Edit distance","Linguistics","Similarity measure","Data mining"],"sdg_mappings":[{"sdg_number":0,"sdg_label":"Quality Education"}],"linked_datasets":[],"clinical_trials":[],"software_tools":[],"database_accessions":[],"source":"live","citation_network_status":"fetched"},"created_at":"2026-07-30T01:41:32.093595Z","pmid":null,"pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}