数据资源-深度学习与数据挖掘数据集

AI研习图书馆,发现不一样的世界

深度学习与数据挖掘数据资源

前言

数据整理是算法研究工作的重要基础,本文主要搜集整理了一些数据采集网站和常用数据集下载网址。

数据资源

一、常用数据收集网站

1、Public Data Sets on Amazon Web Services (AWS)
http://aws.amazon.com/datasets
Amazon从2008年开始就为开发者提供几十TB的开发数据。

2、Yahoo! Webscope
http://webscope.sandbox.yahoo.com/index.php

3、Konect is a collection of network datasets
http://konect.uni-koblenz.de/

4、Stanford Large Network Dataset Collection
http://snap.stanford.edu/data/index.html

二、互联网相关数据集

1、Dataset for "Statistics and Social Network of YouTube Videos"
http://netsg.cs.sfu.ca/youtubedata/

2、1998 World Cup Web Site Access Logs
http://ita.ee.lbl.gov/html/contrib/WorldCup.html
这个是1998年世界杯期间的数据集。从1998/04/26 到 1998/07/26 的92天中,发生了 1,352,804,107次请求。

3、Page view statistics for Wikimedia projects
http://dammit.lt/wikistats/

4、AOL Search Query Logs - RP
http://www.researchpipeline.com/mediawiki/index.php?title=AOL_Search_Query_Logs

5、livedoor gourmet
http://blog.livedoor.jp/techblog/archives/65836960.html

三、海量图像数据集

1、ImageNet
http://www.image-net.org/
包含1400万的图像。

2、Tiny Images Dataset
http://horatio.cs.nyu.edu/mit/tiny/data/index.html
包含8000万的32x32图像。

3、 MirFlickr1M
http://press.liacs.nl/mirflickr/
Flickr中的100万的图像集。

4、 CoPhIR
http://cophir.isti.cnr.it/whatis.html
Flickr中的1亿600万的图像

5、SBU captioned photo dataset
http://dsl1.cewit.stonybrook.edu/~vicente/sbucaptions/
Flickr中的100万的图像集。

6、Large-Scale Image Annotation using Visual Synset(ICCV 2011)
http://cpl.cc.gatech.edu/projects/VisualSynset/
包含2亿图像

7、NUS-WIDE
http://lms.comp.nus.edu.sg/research/NUS-WIDE.htm
Flickr中的27万的图像集。

8、SUN dataset
http://people.csail.mit.edu/jxiao/SUN/
包含13万的图像

9、MSRA-MM
http://research.microsoft.com/en-us/projects/msrammdata/
包含100万的图像,23000视频

10、TRECVID
http://trecvid.nist.gov/

Stack Overflow Dump Files
7.3G stackoverflow.com-Posts.7z
573.1K stackoverflow.com-Tags.7z
153.0M stackoverflow.com-Users.7z
2.2G stackoverflow.com-Comments.7z

10、雅虎发布超大Flickr数据集 1亿的图片+视频
http://yahoolabs.tumblr.com/post/89783581601/one-hundred-million-creative-commons-flickr-images-for

截止目前好像还没有国内的企业或者组织开放自己的数据集。希望也能有企业开发自己的数据集给研究人员使用,从而推动海量数据处理在国内的发展!

四、数据挖掘常用数据集

1、气候监测数据集 http://cdiac.ornl.gov/ftp/ndp026b

2、几个实用的测试数据集下载的网站
http://www.fs.fed.us/fire/fuelman/
http://www.cs.toronto.edu/~roweis/data.html
http://kdd.ics.uci.edu/summary.task.type.html

在下面的网址可以找到reuters数据集:http://www.research.att.com/~lewis/reuters21578.html
该网址有各种数据集:http://kdd.ics.uci.edu/summary.data.type.html
进行文本分类,还有一个数据集是可以用的,即rainbow的数据集
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

3、UCI收集的机器学习数据集
ftp://pami.sjtu.edu.cn/
http://www.ics.uci.edu/~mlearn//MLRepository.htm

4、statlib
http://liama.ia.ac.cn/SCILAB/scilabindexgb.htm
http://lib.stat.cmu.edu/

5、关于基金的数据挖掘的网站
http://www.gotofund.com/index.asp

http://lans.ece.utexas.edu/~strehl/

6、进行文本分类&WEB
http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html

http://www.w3.org/TR/WD-logfile-960221.html
http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog
http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html

7、时间序列数据的网址
http://www.stat.wisc.edu/~reinsel/bjr-data/

8、apriori算法的测试数据
http://www.almaden.ibm.com/cs/quest/syndata.html

9、数据生成器的链接
http://www.cse.cuhk.edu.hk/~kdd/data_collection.html
http://www.almaden.ibm.com/cs/quest/syndata.html
10、关联
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar
http://www.almaden.ibm.com/software/quest/Resources/datasets/syndata.html#assocSynData

11、WEKA
http://flow.dl.sourceforge.net/sourceforge/weka/regression-datasets.jar

12、癌症基因:
http://www.broad.mit.edu/cgi-bin/cancer/datasets.cgi

13、金融数据:
http://lisp.vse.cz/pkdd99/Challenge/chall.htm

14、一个很好的资源网址为:http://kdd.ics.uci.edu/,里面包含的数据资源按应用领域划分的。

数据资源-深度学习与数据挖掘数据集

深度学习知识图谱

2021-04-16 原文

数据资源-深度学习与数据挖掘数据集的相关文章

收藏:盘点机器学习的顶级数据资源TOP 8,如何做好深度学习,少些弯路少些坑?

公众号后台回复:管理1904,免费下载本月推荐精品管理类图书 公众号后台回复:人文历史1904,免费下载本月推荐精品人文历史类图书 加入"ICT销售和大客户联盟"(微信ID:ICT ...

如何利用学科资源进行深度学习

陆启威 如何利用学科资源进行深度学习?这需要在充分研究学科资源的基础上进行精心的组织和设计,从学科内容的"深度挖掘"和学生素质的"深度培养"上加以关注和考量. ...

数据资源-CIFAR10数据集解析及分享

AI研习图书馆,发现不一样的世界 CIFAR-10数据集解析 简介 CIFAR-10和CIFAR-100是来自于80 million张小型图片的数据集,图片收集者是Alex Krizhevsky, V ...

数据资源-MiniImageNet数据集解析及分享

AI研习图书馆,发现不一样的世界 MiniImageNet数据解析 简介 MiniImageNet数据集节选自ImageNet数据集.ImageNet是一个非常有名的大型视觉数据集,它的建立旨在促进视 ...

数据资源-ImageNet数据集解析及分享

AI研习图书馆,发现不一样的世界 ILSVRC2012数据解析 简介 ILSVRC2012数据集,即大名鼎鼎ImageNet2012竞赛的数据集,在图像分类数据集中属于最常用的跑分数据集和预训练数据集 ...

资源分享-动手学深度学习

AI研习图书馆,发现不一样的世界 <动手学深度学习> 信息化时代,最不缺的就是学习资源了~ 书籍介绍 <动手学深度学习>,这本书原版的名字叫<Dive into deep ...

【软件工具】深度学习论文,如何画出漂亮的算法结构图?这个项目轻松帮你搞定

AI研习图书馆,发现不一样的精彩世界 ML visual-开源绘图项目 一.引言 随着人工智能技术的蓬勃发展,进入深度学习领域做科研的学者越来越多,深度学习研究呈现出百家争鸣.百花齐花的大好形势.众所 ...

[深度学习] &#39;颅骨内脑膜瘤&#39;的病理与临床特点及影像诊断(建议收藏)~~~

颅骨内脑膜瘤 病理与临床特点 颅骨内脑膜瘤(intraosseous meningioma)也称颅骨脑膜瘤或板障脑膜瘤,较少见,约占脑膜瘤2%以下.可能起自于异位于板障或嵌顿于颅缝的蛛网膜细胞.不包括 ...

深度学习必须掌握的13种概率分布

仅做学术分享,如有侵权,联系删除 转载于 :深度学习前沿 作为机器学习从业者,你需要知道概率分布相关的知识.这里有一份最常见的基本概率分布教程,大多数和使用 python 库进行深度学习有关. 概率分 ...