SYNTOLOGY HomeExplorerAtlasCodeMethodologyAboutDevelopersFeedPricing
Paper · 1901.08746 · 2019

BioBERT: a pre-trained biomedical language representation model for biomedical text mining

arXiv · PDF · Open in the Atlas

Code that ran

We lifted 25 functions out of this paper's own repositories and ran 14 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.

RepositoryRoleRan
dmis-lab/bern pwc_unofficial 9 of 20
phucdev/TL_Bio_RE pwc_unofficial 3 of 3
copy not recorded — 1 of 1
EmilyAlsentzer/clinicalBERT extension 1 of 1
FunctionStatusWhere it lives
accuracy Ran this paper's copy was not recorded; identical code first harvested from xuyige/BERT4doc-Classification
pointer only · get_code("eb725d5794b15f6b")
convert_examples_to_features Ran EmilyAlsentzer/clinicalBERT/downstream_tasks/run_classifier.py
code served (permissive licence) · get_code("06b922528ebf4e7d")
convert_examples_to_features Ran phucdev/TL_Bio_RE/tlbiore/dataset_readers/readers.py
code served (permissive licence) · get_code("13645454ee9a48df")
convert_to_unicode Ran dmis-lab/bern/biobert_ner/tokenization.py
code served (permissive licence) · get_code("1923fc05163d207d")
count_entities Ran dmis-lab/bern/server.py
code served (permissive licence) · get_code("cb11382d4dfba32c")
example_input_fn Ran dmis-lab/bern/biobert_ner/fast_predict2.py
code served (permissive licence) · get_code("9f260f0f69ef7785")
get_activation Ran dmis-lab/bern/biobert_ner/modeling.py
code served (permissive licence) · get_code("2dc172f4dc0c745c")
get_label Ran phucdev/TL_Bio_RE/tlbiore/utils.py
code served (permissive licence) · get_code("0f7620720c0761a8")
get_predict_pair_ids Ran phucdev/TL_Bio_RE/tlbiore/utils.py
code served (permissive licence) · get_code("76656b04052ade73")
get_stats Ran dmis-lab/bern/service_checker.py
code served (permissive licence) · get_code("549c4d310160c2df")
input_form Ran dmis-lab/bern/biobert_ner/ops.py
code served (permissive licence) · get_code("07b9d1982202e17a")
isInt Ran dmis-lab/bern/biobert_ner/ops.py
code served (permissive licence) · get_code("4a5aed3ff2a20598")
json_to_sent Ran dmis-lab/bern/biobert_ner/ops.py
code served (permissive licence) · get_code("129d9b786094b9f2")
run_command Ran dmis-lab/bern/utils.py
code served (permissive licence) · get_code("7db82cce6fd97e13")
file_based_input_fn_builder Not yet run dmis-lab/bern/biobert_ner/run_ner.py
code served (permissive licence) · get_code("925eb3d68d846286")
gelu Not yet run dmis-lab/bern/biobert_ner/modeling.py
code served (permissive licence) · get_code("6558b9f62bb65244")
get_assignment_map_from_checkpoint Not yet run dmis-lab/bern/biobert_ner/modeling.py
code served (permissive licence) · get_code("50958618b65e514e")
get_pubmed_xml Not yet run dmis-lab/bern/download.py
code served (permissive licence) · get_code("d99e3a923de61df6")
load_vocab Not yet run dmis-lab/bern/biobert_ner/tokenization.py
code served (permissive licence) · get_code("ff83ccc8b0b6462d")
printable_text Not yet run dmis-lab/bern/biobert_ner/tokenization.py
code served (permissive licence) · get_code("0e5615f8994003cf")
pubtator2dict_list Not yet run dmis-lab/bern/convert.py
code served (permissive licence) · get_code("8efd15b4de560c86")
pubtatorstr2dict_list Not yet run dmis-lab/bern/convert.py
code served (permissive licence) · get_code("abf03461f901b84e")
query Not yet run dmis-lab/bern/utils.py
code served (permissive licence) · get_code("63af112374694328")
query_raw Not yet run dmis-lab/bern/utils.py
code served (permissive licence) · get_code("038a5858855dfabd")
tell_inputfile Not yet run dmis-lab/bern/server.py
code served (permissive licence) · get_code("183875341edd669d")

Repositories linked to this paper

Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.

Abstract

Biomedical text mining is becoming increasingly important as the number of biomedical documents rapidly grows. With the progress in natural language processing (NLP), extracting valuable information from biomedical literature has gained popularity among researchers, and deep learning has boosted the development of effective biomedical text mining models. However, directly applying the advancements in NLP to biomedical text mining often yields unsatisfactory results due to a word distribution shift from general domain corpora to biomedical corpora. In this article, we investigate how the recently introduced pre-trained language model BERT can be adapted for biomedical corpora. We introduce BioBERT (Bidirectional Encoder Representations from Transformers for Biomedical Text Mining), which is a domain-specific language representation model pre-trained on large-scale biomedical corpora. With almost the same architecture across tasks, BioBERT largely outperforms BERT and previous state-of-the-art models in a variety of biomedical text mining tasks when pre-trained on biomedical corpora. While BERT obtains performance comparable to that of previous state-of-the-art models, BioBERT significantly outperforms them on the following three representative biomedical text mining tasks: biomedical named entity recognition (0.62% F1 score improvement), biomedical relation extraction (2.80% F1 score improvement) and biomedical question answering (12.24% MRR improvement). Our analysis results show that pre-training BERT on biomedical corpora helps it to understand complex biomedical texts. We make the pre-trained weights of BioBERT freely available at https://github.com/naver/biobert-pretrained, and the source code for fine-tuning BioBERT available at https://github.com/dmis-lab/biobert.

For agents

The same record, over MCP at https://syntology.ai/mcp:

get_harvested_code_for_paper("1901.08746")
get_code_for_paper("1901.08746")
have("1901.08746")

Connect an agent — have() is free.