pythonic生物人

一图胜千言,如何成为数据科学家?

成为一个Data Scientist,只需要“ 简单 ”8个步骤。

以下,小编简单介绍各步骤,并附经典学习资料链接。

step1、学好数学、统计学和机器学习

  • 可汗学院(khan academy) 免费数学课 :https://zh.khanacademy.org/math

包含微积分、线性代数等,

  • MIT Gilbert Strang 线性代数公开课 :https://open.163.com/newview/movie/courseintro?newurl=%2Fspecial%2Fopencourse%2Fdaishu.html
  • MIT Gilbert Strang 线性代数公开习题课 :https://open.163.com/newview/movie/free?pid=MBKJ0DQ52&mid=MBKJ0MDH1
  • udacity的 统计学课 :https://classroom.udacity.com/courses/st101
  • 统计学导论 OpenIntro Statistics:https://stat.duke.edu/books/openintro-statistics
  • 吴恩达(Andrew Ng) 机器学习143讲 :https://study.163.com/course/introduction/1210076550.htm

step2、学习编程语言

  • Harvard 计算机科学基础CS50 :https://open.163.com/newview/movie/free?pid=M6U6LS8CV&mid=M6U6MHDUR
  • 编程语言 :Python/R/SAS/SPSS等等,网上大把免费课程。

step3、理解数据库

在企业中,数据常常使用数据库存储,需要学习数据库知识。

  • 入门推荐1, 书籍 《SQL必知必会》、《MySQL必知必会》
  • 入门推荐2, sqlzoo :https://igs.sqlzoo.net/ 一个免费在线网站,提供sql免费练习,提供答案的那种 。 精进,见上面信息图。

step4、掌握数据清洗、可视化、结果报表

  • 数据清洗 :Python中的datatable、pandas、Polars等;R中的data.table、dplyr等。
部分可参考,
datatable-让Python数据分析更快
谁是Python/R/Julia数据处理工具库中的最强武器?
Pandas 75个高频操作
  • 数据可视化 :Matplotlib、Seaborn、ggplot2、D3.js等。
部分可参考,
最有价值50图表(python实现代码)
《ggplot2:数据分析与图形艺术》最新中文版
如何驾驭ggplot2?
  • 结果报表 :工具如tableau、Markdown、excel、Power BI 等等。

step5、点亮大数据技能

当处理的数据大到无法在一定时间内使用常规软件工具进行存储、计算时,BIG DATA出现;

大数据主要涉及: 大数据存储 (Hadoop分布式存储、分布式文件系统HDFS等); 大数据计算 (Hadoop分布式计算、分布式计算框架MapReduce等),以及后面基于Hadoop兴起的Spark等大数据生态圈。

step6、获得取实战经验、实践、结识数据科学家 大佬

比如, 参加Kaggle/天池/Codalab等竞赛、去fellow大佬、搞开源项目、搞个公众号 😄。

总之,少说,多实践。 部分可参考,
那些重塑R/Python世界的巨擘们!

step7、参加实习、训练营或直接工作

step8、积极贡献开源社区

开源改变世界,持续精进。

ref: https://www.datacamp.com/blog/how-to-become-a-data-scientist 高清png获取 「pythonic生物人」后台 回复 8steps 干货直达: Python可视化 、 R可视化 、 Python精进 、 图解统计学 、 机器学习 、 科研等 微信交流 备注来意 (交流群、合作等等)