MCPcopy Create free account
hub / github.com/BIT-DataLab/LakeBench / minhash_multi_process

Function minhash_multi_process

join/LSH/LSH_benchmark_wlq.py:166–190  ·  view source on GitHub ↗
(file_list, q, param_dic, id)

Source from the content-addressed store, hash-verified

164 # print("{} end,size={}".format(id,len(sizes)))
165
166def minhash_multi_process(file_list, q, param_dic, id):
167 # print("{} start".format(id))
168 lsh = MinHashLSHEnsemble(threshold=param_dic['threshold'], num_perm=param_dic['num_perm'],
169 num_part=param_dic['num_part'], m=param_dic['m'], storage_config=param_dic['storage_config'])
170 for i, (lower, upper) in enumerate(param_dic["partitions"]):
171 lsh.lowers[i], lsh.uppers[i] = lower, upper
172 for i, sets_file in enumerate(file_list):
173 df = pd.read_csv(sets_file, dtype='str', lineterminator='\n').dropna()
174 columns = df.columns.tolist()
175 data = df.values.T.tolist()
176 for column, vals in zip(columns, data):
177 # 需要对value去重
178 vals = list(set(vals))
179 # 域的键值
180 key = sets_file + "." + column
181 # 生成minhash
182 mh = MinHash(param_dic['num_perm'], hashfunc=_hash_32)
183 for word in vals:
184 mh.update(str(word))
185 lsh.index((key, mh, len(vals)))
186 if id==0:
187 sys.stdout.write("\rId 0 Process Read and minhash {}/{} files".format(i+1, len(file_list)))
188 if id==0:
189 sys.stdout.write("\n")
190 q.put(lsh)
191
192# 将csv文件列表中每个表格中的column转换为三元组(minhashes, sets, keys)形式
193# @profile

Callers

nothing calls this directly

Calls 5

updateMethod · 0.95
indexMethod · 0.95
MinHashLSHEnsembleClass · 0.90
MinHashClass · 0.90
writeMethod · 0.80

Tested by

no test coverage detected