{"doi":"10.1093/bioinformatics/btab283","title":"DECODE: a <i>De</i> ep-learning framework for <i>Co</i> n <i>de</i> nsing enhancers and refining boundaries with large-scale functional assays","abstract":"MOTIVATION: Mapping distal regulatory elements, such as enhancers, is a cornerstone for elucidating how genetic variations may influence diseases. Previous enhancer-prediction methods have used either unsupervised approaches or supervised methods with limited training data. Moreover, past approaches have implemented enhancer discovery as a binary classification problem without accurate boundary detection, producing low-resolution annotations with superfluous regions and reducing the statistical power for downstream analyses (e.g. causal variant mapping and functional validations). Here, we addressed these challenges via a two-step model called Deep-learning framework for Condensing enhancers and refining boundaries with large-scale functional assays (DECODE). First, we employed direct enhancer-activity readouts from novel functional characterization assays, such as STARR-seq, to train a deep neural network for accurate cell-type-specific enhancer prediction. Second, to improve the annotation resolution, we implemented a weakly supervised object detection framework for enhancer localization with precise boundary detection (to a 10 bp resolution) using Gradient-weighted Class Activation Mapping. RESULTS: Our DECODE binary classifier outperformed a state-of-the-art enhancer prediction method by 24% in transgenic mouse validation. Furthermore, the object detection framework can condense enhancer annotations to only 13% of their original size, and these compact annotations have significantly higher conservation scores and genome-wide association study variant enrichments than the original predictions. Overall, DECODE is an effective tool for enhancer classification and precise localization. AVAILABILITY AND IMPLEMENTATION: DECODE source code and pre-processing scripts are available at decode.gersteinlab.org. SUPPLEMENTARY INFORMATION: Supplementary data are available at Bioinformatics online.","journal":"Bioinformatics","year":2021,"id":192066,"datarank":0.0,"base_score":0.0,"endowment":0.0,"self_citation_contribution":0.0,"citation_network_contribution":0.0,"self_endowment_contribution":0.0,"citer_contribution":0.0,"corpus_percentile":null,"corpus_rank":null,"citation_count":12,"citer_count":0,"citers_with_citation_signal":0,"citers_with_endowment":0,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":0.9517,"is_data_producer":false,"deposit_databanks":null,"is_oa":true,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":"2021-01-01","fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":233287,"name":"Jing Zhang","orcid":"0009-0002-1939-7952","position":1,"is_corresponding":false},{"id":21432,"name":"Jason Liu","orcid":"0000-0001-7197-7319","position":2,"is_corresponding":false},{"id":758530,"name":"Yi Dai","orcid":"0000-0003-1219-2436","position":3,"is_corresponding":false},{"id":13124,"name":"Donghoon Lee","orcid":"0000-0003-0453-6059","position":4,"is_corresponding":false},{"id":373766,"name":"Martin Renqiang Min","orcid":"0000-0002-8563-6133","position":5,"is_corresponding":false},{"id":275738,"name":"Min Xu","orcid":"0000-0002-7206-0059","position":6,"is_corresponding":false},{"id":108504,"name":"Mark Gerstein","orcid":"0000-0002-9746-3719","position":7,"is_corresponding":false},{"id":454691,"name":"Zhanlin Chen","orcid":"0000-0002-5835-3840","position":0,"is_corresponding":true}],"reference_count":49,"raw_metadata":null,"created_at":"2026-07-18T23:49:39.281850Z","pmid":"34252960","pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}