Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/DengBoCong/nlp-paper
/ functions
Functions
229 in github.com/DengBoCong/nlp-paper
⨍
Functions
229
◇
Types & classes
26
Function
load_token_dict
加载字典方法 :return:input_token, target_token
paper-code/tensorflow_src/models/task/common/data_utils.py:101
Function
loss_func_mask
屏蔽填充的SparseCategoricalCrossentropy损失 真实标签real中有0填充部分,这部分不记入预测损失 :param weights: 样本权重 :param real: 真实标签张量 :param pred: logits张量
paper-code/tensorflow_src/models/informer.py:24
Function
luong_attention_concat
:param units: 全连接层单元数
paper-code/tensorflow_src/tools/attention.py:26
Function
luong_attention_dot
:param query: decoder的前一个状态 :param value: encoder的output
paper-code/tensorflow_src/tools/attention.py:46
Function
max_length
:param tensor: :return: 列表中最大的长度
paper-code/tensorflow_src/models/task/common/data_utils.py:48
Function
preprocess_raw_data
用来对原始文本进行预处理的方法,主要是将原 始文本进行分词后,保存在一个新的文本中,供后继使用 Args: raw_data: 原始数据路径 tokenized_data: 生成token数据保存路径 Returns:
paper-code/pytorch_src/common/pre_treat.py:7
Function
preprocess_raw_data
处理原始数据,并将处理后的数据保存为TFRecord格式 :param data_path: 原始数据路径 :param record_data_path: 分词好的数据路径 :param dict_path: 字典保存路径 :param max_len: 最大序
paper-code/tensorflow_src/tools/preprocess_tfrecord.py:29
Function
preprocess_raw_data_not_tokenized
处理原始数据,并将处理后的数据保存为TFRecord格式 :param data_path: 原始数据路径 :param record_data_path: 分词好的数据路径 :param max_len: 最大序列长度 :param max_data_size:
paper-code/tensorflow_src/tools/preprocess_tfrecord.py:94
Function
preprocess_request
(sentence, start_sign, end_sign, token, max_length)
paper-code/pytorch_src/common/data_utils.py:24
Function
prob_attention
(batch_size: Any, num_heads: Any, depth: Any, factor: Any = 5, mask: Any = None, d_type: tf
paper-code/tensorflow_src/models/informer.py:170
Function
prob_mask
(B, H, L, index, scores)
paper-code/tensorflow_src/models/informer.py:51
Function
request_slot_tracker
requestable插槽跟踪器,requestable插槽是用户询问系统的信息 用来获得时间t的状态的非分类插槽槽值分布, 比如: address=1 (地址被询问) phone=0 (用户不关心电话号码) 输入为状态跟踪器的输入'state_t'
paper-code/tensorflow_src/models/task/model/tracker.py:16
Method
reset
(self)
paper-code/tensorflow_src/models/task/common/data_utils.py:350
Method
respond
对外部聊天请求进行回复 子类需要利用模型进行推断和搜索以产生回复。 :param req: 外部聊天请求字符串 :return: 系统回复字符串
paper-code/tensorflow_src/models/task/model/chatter.py:34
Method
search
(self, key, value)
paper-code/tensorflow_src/models/task/common/kb.py:44
Method
search_paper
(self)
search_kits.py:240
Function
sequences_to_texts
将序列转换成text
paper-code/pytorch_src/common/data_utils.py:157
Function
sequences_to_texts
将序列转换成text
paper-code/tensorflow_src/models/task/common/data_utils.py:122
Function
slice_neg_pos_data
文本匹配中句子对数据增强 :param data_path: 原始数据集路径 :param save_path: 数据增强瘦的数据保存路径 :param if_self: 是否使用自身pairs :return:
paper-code/data_enhancement.py:6
Function
smn
SMN的模型,在这里将输入进行accumulate之后,得 到匹配对的向量,然后通过这些向量计算最终的分类概率 Args: units: GRU单元数 vocab_size: embedding词汇量 embedding_di
paper-code/tensorflow_src/models/smn.py:59
Function
state_tracker
(units, vocab_size, embedding_dim, name="state_tracker")
paper-code/tensorflow_src/models/task/model/tracker.py:30
Function
task
Task-Orient模型,使用函数式API实现,将encoder和decoder封装 :param vocab_size:token大小
paper-code/tensorflow_src/models/nbt.py:76
Function
task
Task-Orient模型,使用函数式API实现,将encoder和decoder封装 :param vocab_size:token大小
paper-code/tensorflow_src/models/task/model/model.py:44
Function
text_to_phonemes_converter
将句子按照CMU音素字典进行分词切分 :param text: 单个句子文本 :param cmu_dict_path: cmu音素字典路径 :return: 按照音素分词好的数组
paper-code/tensorflow_src/tools/en_text_to_phoneme.py:37
Function
text_to_sequence
专用于phoneme的text转序列的方法 :param texts: 文本序列列表 :param max_len: 文本序列最大长度 :return: 转换后的id序列
paper-code/tensorflow_src/tools/en_text_to_phoneme.py:6
Method
train
对模型进行训练
paper-code/tensorflow_src/models/task/model/chatter.py:60
Function
transformer
transformer的粗粒度的结构实现,在忽略细节的情况下,看作是 encoder和decoder的实现,这里需要注意的是,因为是使用self_attention, 所以在输入的时候,这里需要进行mask,防止暴露句子中带预测的信息,影响 模型的效果 :p
paper-code/tensorflow_src/models/transformer.py:201
Function
transformer_scheduled_sample
Transformer应用Scheduled Sample Args: vocab_size:token大小 num_layers:编码解码层的数量 units:单元大小 d_model:深度 num_
paper-code/tensorflow_src/models/transformer.py:277
Function
triangular_causal_mask
(B, L)
paper-code/tensorflow_src/models/informer.py:43
← previous
201–229 of 229, ranked by callers