fundata 1.0.1__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
fundata-1.0.1/PKG-INFO ADDED
@@ -0,0 +1,44 @@
1
+ Metadata-Version: 2.1
2
+ Name: fundata
3
+ Version: 1.0.1
4
+ Summary: Add your description here
5
+ Requires-Python: >=3.8
6
+ Description-Content-Type: text/markdown
7
+
8
+ # notedata
9
+
10
+ 在学习和工作过程中,经常用到一些比较通用的数据集,很多是国外的数据集,下载很慢。
11
+ 这里整理一些数据,并转存到蓝奏云,如果后续有免费的公有云,也可以再迁移到其他云盘。
12
+
13
+
14
+
15
+ |序号|分类|名称|描述|官网下载|蓝奏下载|
16
+ |:-:|:-:|:-:|:-:|:-:|:-:|
17
+ |0|dataset|iris|iris数据集|[官网链接](https://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data)|暂无|
18
+ |1|dataset|electronics-reviews|Amazon评论数据|[官网链接](http://snap.stanford.edu/data/amazon/productGraph/categoryFiles/reviews_Electronics_5.json.gz)|[蓝奏链接](https://wws.lanzous.com/b01hkzfuj)|
19
+ |2|dataset|electronics-meta|Amazon评论数据|[官网链接](http://snap.stanford.edu/data/amazon/productGraph/categoryFiles/meta_Electronics.json.gz)|[蓝奏链接](https://wws.lanzous.com/b01hqeora)|
20
+ |3|dataset|movielens-100k|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-100k.zip)|[蓝奏链接](https://wws.lanzous.com/iyykCfbi64j)|
21
+ |4|dataset|movielens-1m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-1m.zip)|[蓝奏链接](https://wws.lanzous.com/ihoSUfbi65a)|
22
+ |5|dataset|movielens-10m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-10m.zip)|[蓝奏链接](https://wws.lanzous.com/iXvEmfbi6di)|
23
+ |6|dataset|movielens-20m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-20m.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkt17g)|
24
+ |7|dataset|movielens-25m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-25m.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkt24j)|
25
+ |8|dataset|adult-train||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/adult.data.txt)|暂无|
26
+ |9|dataset|adult-test||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/adult.test.txt)|暂无|
27
+ |10|dataset|porto-seguro-train||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/porto_seguro_train.csv)|暂无|
28
+ |11|dataset|porto-seguro-test||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/porto_seguro_test.csv)|暂无|
29
+ |12|dataset|bitly-usagov||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/datasets/bitly_usagov/example.txt)|暂无|
30
+ |13|dataset|coco-val2017|大型图像数据集, 用于对象检测、分割、人体关键点检测、语义分割和字幕生成|[官网链接](http://images.cocodataset.org/zips/val2017.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkb8fi)|
31
+ |14|dataset|coco-annotations_trainval2017|大型图像数据集, 用于对象检测、分割、人体关键点检测、语义分割和字幕生成|[官网链接](http://images.cocodataset.org/annotations/annotations_trainval2017.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkb86j)|
32
+ |15|model|yolov3.weight|yolov3模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3ih)|
33
+ |16|model|yolov3.h5|yolov3模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3aj)|
34
+ |17|model|yolov4.weight|yolov4模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3yd)|
35
+ |18|model|yolov4-416.h5|yolov4模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hl9lej)|
36
+ |19|dataset|criteo-sample|criteo_sample数据集|[官网链接](https://raw.githubusercontent.com/shenweichen/DeepCTR/master/examples/criteo_sample.txt)|[蓝奏链接](https://wws.lanzous.com/ihLhrhejkxi)|
37
+ |20|dataset|criteo-kaggle|criteo-kaggle数据集|[官网链接](https://s3-eu-west-1.amazonaws.com/kaggle-display-advertising-challenge-dataset/dac.tar.gz)|[蓝奏链接](https://wws.lanzous.com/b01hqh97i)|
38
+
39
+
40
+ 注:蓝奏无法上传大于100MB的数据,将一个数据拆分为多个文件上传,必须用[notedrive](https://github.com/notechats/notedrive) 来下载
41
+
42
+
43
+ # 感谢
44
+ 感谢蓝奏云
@@ -0,0 +1,37 @@
1
+ # notedata
2
+
3
+ 在学习和工作过程中,经常用到一些比较通用的数据集,很多是国外的数据集,下载很慢。
4
+ 这里整理一些数据,并转存到蓝奏云,如果后续有免费的公有云,也可以再迁移到其他云盘。
5
+
6
+
7
+
8
+ |序号|分类|名称|描述|官网下载|蓝奏下载|
9
+ |:-:|:-:|:-:|:-:|:-:|:-:|
10
+ |0|dataset|iris|iris数据集|[官网链接](https://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data)|暂无|
11
+ |1|dataset|electronics-reviews|Amazon评论数据|[官网链接](http://snap.stanford.edu/data/amazon/productGraph/categoryFiles/reviews_Electronics_5.json.gz)|[蓝奏链接](https://wws.lanzous.com/b01hkzfuj)|
12
+ |2|dataset|electronics-meta|Amazon评论数据|[官网链接](http://snap.stanford.edu/data/amazon/productGraph/categoryFiles/meta_Electronics.json.gz)|[蓝奏链接](https://wws.lanzous.com/b01hqeora)|
13
+ |3|dataset|movielens-100k|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-100k.zip)|[蓝奏链接](https://wws.lanzous.com/iyykCfbi64j)|
14
+ |4|dataset|movielens-1m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-1m.zip)|[蓝奏链接](https://wws.lanzous.com/ihoSUfbi65a)|
15
+ |5|dataset|movielens-10m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-10m.zip)|[蓝奏链接](https://wws.lanzous.com/iXvEmfbi6di)|
16
+ |6|dataset|movielens-20m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-20m.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkt17g)|
17
+ |7|dataset|movielens-25m|包含用户对电影的评级数据、电影元数据信息和用户属性信息|[官网链接](http://files.grouplens.org/datasets/movielens/ml-25m.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkt24j)|
18
+ |8|dataset|adult-train||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/adult.data.txt)|暂无|
19
+ |9|dataset|adult-test||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/adult.test.txt)|暂无|
20
+ |10|dataset|porto-seguro-train||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/porto_seguro_train.csv)|暂无|
21
+ |11|dataset|porto-seguro-test||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/recommendation/data/porto_seguro_test.csv)|暂无|
22
+ |12|dataset|bitly-usagov||[官网链接](https://raw.githubusercontent.com/1007530194/data/master/datasets/bitly_usagov/example.txt)|暂无|
23
+ |13|dataset|coco-val2017|大型图像数据集, 用于对象检测、分割、人体关键点检测、语义分割和字幕生成|[官网链接](http://images.cocodataset.org/zips/val2017.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkb8fi)|
24
+ |14|dataset|coco-annotations_trainval2017|大型图像数据集, 用于对象检测、分割、人体关键点检测、语义分割和字幕生成|[官网链接](http://images.cocodataset.org/annotations/annotations_trainval2017.zip)|[蓝奏链接](https://wws.lanzous.com/b01hkb86j)|
25
+ |15|model|yolov3.weight|yolov3模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3ih)|
26
+ |16|model|yolov3.h5|yolov3模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3aj)|
27
+ |17|model|yolov4.weight|yolov4模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hjn3yd)|
28
+ |18|model|yolov4-416.h5|yolov4模型的权重|暂无|[蓝奏链接](https://wws.lanzous.com/b01hl9lej)|
29
+ |19|dataset|criteo-sample|criteo_sample数据集|[官网链接](https://raw.githubusercontent.com/shenweichen/DeepCTR/master/examples/criteo_sample.txt)|[蓝奏链接](https://wws.lanzous.com/ihLhrhejkxi)|
30
+ |20|dataset|criteo-kaggle|criteo-kaggle数据集|[官网链接](https://s3-eu-west-1.amazonaws.com/kaggle-display-advertising-challenge-dataset/dac.tar.gz)|[蓝奏链接](https://wws.lanzous.com/b01hqh97i)|
31
+
32
+
33
+ 注:蓝奏无法上传大于100MB的数据,将一个数据拆分为多个文件上传,必须用[notedrive](https://github.com/notechats/notedrive) 来下载
34
+
35
+
36
+ # 感谢
37
+ 感谢蓝奏云
@@ -0,0 +1,7 @@
1
+ [project]
2
+ name = "fundata"
3
+ version = "1.0.1"
4
+ description = "Add your description here"
5
+ readme = "README.md"
6
+ requires-python = ">=3.8"
7
+ dependencies = []
@@ -0,0 +1,4 @@
1
+ [egg_info]
2
+ tag_build =
3
+ tag_date = 0
4
+
@@ -0,0 +1,7 @@
1
+ #!/usr/bin/env python
2
+ # -*- coding: utf-8 -*-
3
+ # @Time : 2019/04/02 20:01
4
+ # @Author : niuliangtao
5
+ # @Site :
6
+ # @File : __init__.py.py
7
+ # @Software: PyCharm
@@ -0,0 +1,8 @@
1
+ from .core import (
2
+ get_adult_data,
3
+ get_bitly_usagov_data,
4
+ get_electronics,
5
+ get_movielens,
6
+ get_porto_seguro_data,
7
+ )
8
+ from .datas import CriteoData, ElectronicsData
@@ -0,0 +1,74 @@
1
+ import pandas as pd
2
+ from .datas import ElectronicsData
3
+ from notedata.manage import DatasetManage
4
+ from notetool.tool import log
5
+
6
+ logger = log(__name__)
7
+
8
+
9
+ def get_electronics(dataset: DatasetManage = None):
10
+ electronic = ElectronicsData(dataset=dataset, data_path="./download/")
11
+ electronic.init_data()
12
+
13
+
14
+ def get_movielens(dataset: DatasetManage = None):
15
+ dataset.download("movielens-100k", overwrite=False)
16
+ dataset.download("movielens-1m", overwrite=False)
17
+ dataset.download("movielens-10m", overwrite=False)
18
+ dataset.download("movielens-20m", overwrite=False)
19
+ dataset.download("movielens-25m", overwrite=False)
20
+ # os.system('cd ' + file_path(data.path) + ' && unzip ' + file_name(data.path))
21
+
22
+
23
+ def get_adult_data(dataset: DatasetManage = None):
24
+ data_train = dataset.download("adult-train", overwrite=False)
25
+ data_test = dataset.download("adult-test", overwrite=False)
26
+
27
+ print(data_test)
28
+ train_data = pd.read_table(data_train.path, header=None, delimiter=",")
29
+ test_data = pd.read_table(
30
+ data_test.path, header=None, delimiter=",", error_bad_lines=False
31
+ )
32
+
33
+ # all_columns = ['age', 'workclass', 'fnlwgt', 'education', 'education-num', 'marital-status', 'occupation',
34
+ # 'relationship', 'race', 'sex', 'capital-gain', 'capital-loss', 'hours-per-week', 'native-country',
35
+ # 'label', 'type']
36
+ #
37
+ # continus_columns = ['age', 'fnlwgt', 'education-num', 'capital-gain', 'capital-loss', 'hours-per-week']
38
+ # dummy_columns = ['workclass', 'education', 'marital-status', 'occupation', 'relationship', 'race', 'sex',
39
+ # 'native-country']
40
+ #
41
+ # train_data['type'] = 1
42
+ # test_data['type'] = 2
43
+ #
44
+ # all_data = pd.concat([train_data, test_data], axis=0)
45
+ # all_data.columns = all_columns
46
+ #
47
+ # all_data = pd.get_dummies(all_data, columns=dummy_columns)
48
+ #
49
+ # test_data = all_data[all_data['type'] == 2].drop(['type'], axis=1)
50
+ # train_data = all_data[all_data['type'] == 1].drop(['type'], axis=1)
51
+ #
52
+ # train_data['label'] = train_data['label'].map(lambda x: 1 if x.strip() == '>50K' else 0)
53
+ # test_data['label'] = test_data['label'].map(lambda x: 1 if str(x).strip() == '>50K.' else 0)
54
+ #
55
+ # for col in continus_columns:
56
+ # ss = StandardScaler()
57
+ # train_data[col] = ss.fit_transform(train_data[[col]].astype(np.float64))
58
+ # test_data[col] = ss.transform(test_data[[col]].astype(np.float64))
59
+ #
60
+ # train_y = train_data['label']
61
+ # train_x = train_data.drop(['label'], axis=1)
62
+ # test_y = test_data['label']
63
+ # test_x = test_data.drop(['label'], axis=1)
64
+ #
65
+ # return train_x, train_y, test_x, test_y
66
+
67
+
68
+ def get_porto_seguro_data(dataset: DatasetManage = None):
69
+ dataset.download("porto-seguro-train")
70
+ dataset.download("porto-seguro-test")
71
+
72
+
73
+ def get_bitly_usagov_data(dataset: DatasetManage = None):
74
+ dataset.download("bitly-usagov")