{"doi":"10.1101/573782","title":"Sequential compression of gene expression across dimensionalities and methods reveals no single best method or dimensionality","abstract":"<h4>Background</h4> Unsupervised compression algorithms applied to gene expression data extract latent, or hidden, signals representing technical and biological sources of variation. However, these algorithms require a user to select a biologically-appropriate latent dimensionality. In practice, most researchers select a single algorithm and latent dimensionality. We sought to determine the extent by which using multiple dimensionalities across ensemble compression models improves biological representations. <h4>Results</h4> We compressed gene expression data from three large datasets consisting of adult normal tissue, adult cancer tissue, and pediatric cancer tissue. We compressed these data into many latent dimensionalities ranging from 2 to 200. We observed various tradeoffs across latent dimensionalities and compression models. For example, we observed high model stability between principal components analysis (PCA), independent components analysis (ICA), and non-negative matrix factorization (NMF). We identified more unique biological signatures in ensembles of denoising autoencoder (DAE) and variational autoencoder (VAE) models in intermediate latent dimensionalities. However, we captured the most pathway-associated features using all compressed features across algorithms and dimensionalities. Optimized at different latent dimensionalities, compression models detect generalizable gene expression signatures representing sex, neuroblastoma MYCN amplification, and cell types. In two supervised machine learning tasks, compressed features optimized predictions at different latent dimensionalities. <h4>Conclusions</h4> There is no single best latent dimensionality or compression algorithm for analyzing gene expression data. Instead, using feature ensembles from different compression models across latent space dimensionalities optimizes biological representations.","journal":"bioRxiv (Cold Spring Harbor Laboratory)","year":2019,"id":3431,"datarank":0.47646658103661654,"base_score":2.302585092994046,"endowment":2.302585092994046,"self_citation_contribution":0.3453877639491069,"citation_network_contribution":0.13107881708750965,"self_endowment_contribution":0.3453877639491069,"citer_contribution":0.13107881708750965,"corpus_percentile":null,"corpus_rank":null,"citation_count":9,"citer_count":9,"citers_with_citation_signal":5,"citers_with_endowment":5,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":0.049,"is_data_producer":false,"deposit_databanks":null,"is_oa":true,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":"2019-03-11","fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":1207,"name":"Michael Zietz","orcid":"0000-0003-0539-630X","position":1,"is_corresponding":false},{"id":6612,"name":"Vincent Rubinetti","orcid":"0000-0002-4655-3773","position":2,"is_corresponding":false},{"id":1208,"name":"Daniel S. Himmelstein","orcid":"0000-0002-3012-7446","position":3,"is_corresponding":false},{"id":308,"name":"Casey S. Greene","orcid":"0000-0001-8713-9213","position":4,"is_corresponding":false},{"id":301,"name":"Gregory P. Way","orcid":"0000-0002-0503-9348","position":0,"is_corresponding":true}],"reference_count":72,"raw_metadata":{"citation_network_status":"fetched"},"created_at":"2026-03-01T18:20:47.508186Z","pmid":null,"pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}