SYNTOLOGY HomeExplorerAtlasCodeMethodologyAboutDevelopersFeedPricing
Paper · 2212.09849 · ICLR · 2023

Dataless Knowledge Fusion by Merging Weights of Language Models

Xisen Jin, Xiang Ren, Daniel Preot, Pengxiang Cheng, D Data, Model, Data, Data Data, D Model

arXiv · PDF · Open in the Atlas

Code that ran

We lifted 19 functions out of this paper's own repositories and ran 10 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.

RepositoryRoleRan
bloomberg/dataless-model-merging canonical 10 of 19
FunctionStatusWhere it lives
FedAvgMerger Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("10b9df811ddc6d24")
GroundMetric Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("f3635898362e71cb")
ModelMergerBase Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("c314ef759f51e47d")
TmpLocalModel Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("e823833341bb66b2")
compute_bce_loss Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("9512ea87c384d970")
filter_modules_by_regex Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("af8fc9a6b079dd80")
filter_params_to_merge Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("542bdbc6b44e26fe")
get_component_configs Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("b7a34bad497441a4")
get_reweight_factor Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("d150cc5adcf9981b")
get_submodule Ran bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("253168af406c0497")
DebertaV2ForMultiLabelClassification Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("9f88183c29de2263")
DistilBERTForMultiLabelClassification Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("cb4e87b0878653c2")
GPT2ForMultiLabelClassification Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("dec050be98e95d6a")
MTLModel Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("9410ed9ff867ec7d")
MultiDomainModel Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("80ffc739f078f603")
OptimalTransportMerger Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("cc27cfd051c590d3")
RoBERTaForMultiLabelClassification Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("7ff12c9ca05e8578")
create_model Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("3b2e0a4e703d6201")
create_stl_model Not yet run bloomberg/dataless-model-merging/src/model_merge/ot_merger.py
code served (permissive licence) · get_code("4b49e7003c26de74")

Repositories linked to this paper

Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.

Abstract

Fine-tuning pre-trained language models has become the prevalent paradigm for building downstream NLP models. Oftentimes fine-tuned models are readily available but their training data is not, due to data privacy or intellectual property concerns. This creates a barrier to fusing knowledge across individual models to yield a better single model. In this paper, we study the problem of merging individual models built on different training data sets to obtain a single model that performs well both across all data set domains and can generalize on out-ofdomain data. We propose a dataless knowledge fusion method that merges models in their parameter space, guided by weights that minimize prediction differences between the merged model and the individual models. Over a battery of evaluation settings, we show that the proposed method significantly outperforms baselines such as Fisher-weighted averaging or model ensembling. Further, we find that our method is a promising alternative to multi-task learning that can preserve or sometimes improve over the individual models without access to the training data. Finally, model merging is more efficient than training a multi-task model, thus making it applicable to a wider set of scenarios. 1

For agents

The same record, over MCP at https://syntology.ai/mcp:

get_harvested_code_for_paper("2212.09849")
get_code_for_paper("2212.09849")
have("2212.09849")

Connect an agent — have() is free.