我正在训练一个allennlp crf_tagger。我使用的预测器基于 SentenceTaggerPredictor 。问题是标记化器的论点——在PenceTaggerPredictor的情况下,有一个语言论点。
由于PensioneTaggerPredictor将language=“en_core_web_sm”作为一个实际参数,当我这样做时
Predictor.from_path("model.tar.gz", "sentence_tagger")
标记化器是使用默认语言创建的。但是,如果使用不同的语言对训练数据进行标记化,会发生什么呢。如何指定模型中预测器的参数 config.json 使得 Predictor.from_path 将使用非默认语言构建?
config.json
Predictor.from_path
这个 Predictor.from_path() 方法具有 overrides 在这种情况下可以使用的参数。例如 Predictor.from_path("model.tar.gz", "sentence_tagger", overrides={"dataset_reader.tokenizer.language": "en"}) .
Predictor.from_path()
overrides
Predictor.from_path("model.tar.gz", "sentence_tagger", overrides={"dataset_reader.tokenizer.language": "en"})