Xisen Jin, Xiang Ren, Daniel Preot, Pengxiang Cheng, D Data, Model, Data, Data Data, D Model
We lifted 19 functions out of this paper's own repositories and ran 10 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.
| Repository | Role | Ran |
|---|---|---|
| bloomberg/dataless-model-merging | canonical | 10 of 19 |
| Function | Status | Where it lives |
|---|---|---|
| FedAvgMerger | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("10b9df811ddc6d24") |
| GroundMetric | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("f3635898362e71cb") |
| ModelMergerBase | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("c314ef759f51e47d") |
| TmpLocalModel | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("e823833341bb66b2") |
| compute_bce_loss | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("9512ea87c384d970") |
| filter_modules_by_regex | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("af8fc9a6b079dd80") |
| filter_params_to_merge | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("542bdbc6b44e26fe") |
| get_component_configs | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("b7a34bad497441a4") |
| get_reweight_factor | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("d150cc5adcf9981b") |
| get_submodule | Ran | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("253168af406c0497") |
| DebertaV2ForMultiLabelClassification | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("9f88183c29de2263") |
| DistilBERTForMultiLabelClassification | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("cb4e87b0878653c2") |
| GPT2ForMultiLabelClassification | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("dec050be98e95d6a") |
| MTLModel | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("9410ed9ff867ec7d") |
| MultiDomainModel | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("80ffc739f078f603") |
| OptimalTransportMerger | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("cc27cfd051c590d3") |
| RoBERTaForMultiLabelClassification | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("7ff12c9ca05e8578") |
| create_model | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("3b2e0a4e703d6201") |
| create_stl_model | Not yet run | bloomberg/dataless-model-merging/src/model_merge/ot_merger.py code served (permissive licence) · get_code("4b49e7003c26de74") |
Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.
Fine-tuning pre-trained language models has become the prevalent paradigm for building downstream NLP models. Oftentimes fine-tuned models are readily available but their training data is not, due to data privacy or intellectual property concerns. This creates a barrier to fusing knowledge across individual models to yield a better single model. In this paper, we study the problem of merging individual models built on different training data sets to obtain a single model that performs well both across all data set domains and can generalize on out-ofdomain data. We propose a dataless knowledge fusion method that merges models in their parameter space, guided by weights that minimize prediction differences between the merged model and the individual models. Over a battery of evaluation settings, we show that the proposed method significantly outperforms baselines such as Fisher-weighted averaging or model ensembling. Further, we find that our method is a promising alternative to multi-task learning that can preserve or sometimes improve over the individual models without access to the training data. Finally, model merging is more efficient than training a multi-task model, thus making it applicable to a wider set of scenarios. 1
The same record, over MCP at https://syntology.ai/mcp:
get_harvested_code_for_paper("2212.09849")
get_code_for_paper("2212.09849")
have("2212.09849")
Connect an agent — have() is free.