应用机器学习解决方案,356页pdf
本书面向机器学习初学者、软件工程师和希望深入了解机器学习概念并创建可用于生产的 ML 系统的学生。本书假设你对 Python 有初级的了解。
主要特征
-
机器学习中用于问题制定、数据收集和数据清理的流行技术。 -
全面且有用的机器学习工具,例如 MLFlow、Streamlit 等。 -
涵盖众多机器学习库,包括 Tensorflow、FastAI、Scikit-Learn、Pandas 和 Numpy。
本书讨论了如何通过利用现实世界的数据将机器学习应用于现实世界的问题。在本书中,你将调查数据源,熟悉数据管道,并通过大量示例和案例研究来练习机器学习的工作原理。
本书从高级概念和实现(使用代码!)开始,然后向 ML 系统的现实世界发展。它简要讨论了统计和线性代数的各种概念。你将学习如何制定问题、收集数据、构建模型和调整它。你将了解数据分析、计算机视觉和自然语言处理的用例。你还将探索非线性架构,从而使你能够构建具有多个输入和输出的模型。你将接受有关创建机器学习配置文件、各种机器学习库、统计信息和 FAST API 的教程。
在整本书中,你将使用 Python 来试验机器学习库,例如 Tensorflow、Scikit-learn、Spacy 和 FastAI。这本书将帮助在 Kaggle 和我们的数据集上训练我们的模型。
你会学到什么
-
构建机器学习问题,评估可行性,收集和清理数据。 -
学习首先探索数据、选择和训练机器学习模型。 -
在生产中微调、部署和监控所选模型。 -
发现用于数据分析、计算机视觉和自然语言处理的流行模型。
机器学习是一个新的领域,对于任何新的领域,你都会得到很多有意见的想法。在机器学习中,事情还没有完全标准化。虽然有些做法很常见,而且几乎每次都能提供好的结果。在这本书中,你会发现很多不常见的做法。这些实践将为你提供解决工业界任何机器学习问题的工具,并为你提供技术,通过这些技术你可以创造你的实践。
本书还专注于机器学习思想的实际执行,并与真实世界的数据和真实世界的问题进行博弈。我们将通过各种数据源,了解数据管道的重要性。我们将通过大量的例子和案例研究,让你充分了解机器学习在行业中的作用。
我们将遵循自上而下的机器学习方法,我们将首先通过高层次的想法和实现(通过工作代码!),然后我们将深入研究细节,微调我们的模型。必要时,我们也会深入研究一些机器学习的概念,但本书的总体重点是提供一个实践者的方法。在混乱的数据上创建一个行业标准的机器学习项目,你需要什么技能?我们将绕过一些编程概念以及统计学和线性代数方面的想法。但我们将保持这种最低限度。
目录
在本书的15个章节中,你将学到以下内容。
-
第一章介绍了机器学习的过程,大量的例子和用例说明了如何利用机器学习来制造令人敬畏的产品。它还介绍了很多机器学习的专业术语,使后面的章节更容易理解。 -
第二章讨论了构建任何数据产品的第一步,也就是问题的提出。这是机器学习中最被忽视的领域之一,但在给行业带来价值方面却有着巨大的重要性。本章鼓励读者提出一些问题来评估机器学习问题的可行性。 -
第三章给出了数据采集和清理的技巧和窍门,这是机器学习过程中的第二步。我们将通过各种工具来确保数据的充足性和增强性。我们还将了解获取数据的自动化的必要性。清洗数据是一个棘手的概念,而且经常被误解,本章确保了在清洗数据集时要问什么问题。 -
第四章讨论了机器学习过程中的第三步,即数据探索。我们将了解它的必要性,本章显示了一开始广泛的EDA的缺点,以及它如何将偏见引入机器学习问题中。我们将通过最初的探索,以及可视化的提示。在每一步,本章将解释为什么需要它。 -
第五章有模型选择和调谐技术。本章将介绍一种相当琐碎的选择模型的方法,而不是在一个大的模型空间中搜索。我们将通过几个通常表现良好的初始模型,然后从那里进行模型选择。我们还将学习超参数调整技术。我们将学习一些技巧和窍门来缓解这个时间密集的过程。 -
第六章介绍了模型部署技术。它经历了一个为用户提供使用我们模型的接口的正式过程。我们将通过一些带有python的REST API框架,了解对模型解释技术的需求。本章还介绍了MLFlow等工具,这将有助于读者维护机器学习项目。 -
第七章探讨了数据分析的世界。从这一章开始,我们将进入本书的第二部分,该部分将介绍大量的行业用例。我们将学习数据分析的最佳实践,并通过一个实际的例子。我们将经历第一节(第一-六章)中提到的所有流程,用于表格式数据。 -
第八章描述了如何从头开始建立自定义图像分类器。它将介绍转移学习,以及它是怎样一个革命性的想法。它将介绍深度学习,并提供一个快速的介绍和谈论调整深度学习模型的方法。 -
第九章探讨了一个NLP用例。在这一章中,我们将从头开始建立一个尖端的新闻总结应用。我们将使用网络刮削来获取数据,用迁移学习来训练我们的模型,并学习数据清洗、特征提取技术。我们将通过一个关于RNN的快速指南,然后探索转化器的概念,以及它是如何永远改变NLP世界的。 -
第十章探讨了多输入多输出模型,我们将学习如何超越传统的深度学习架构,使用TensorFlow的功能API构建复杂的网络,我们还将学习模型子分类,构建一个可以向图像提问的视觉问题回答模型。 -
第十一章标志着本书第3节的开始,我们将探索构建机器学习的配置文件。在这一章中,我们将探讨对社区的贡献。探索机器学习的研究领域,学习如何有效地阅读机器学习论文。我们还将探索为开源项目做贡献的途径。最后,我们将谈谈写博客和构建Kaggle内核的问题。 -
第十二章探讨了构建我们的机器学习项目。我们将通过大量的项目,并为每个项目定义目标。然后,我们将探讨一些有用的和未被充分使用的工具,它们可以极大地改善你的机器学习经验。 -
第十三-十五章是本书的第4节,是一些重要库的速成课程,如Numpy、Matplotlib和Pandas(第十三章)。会有线性代数和统计学的速成课程(第十四章),然后是最后一章,给出一个FastAPI速成课程(第十五章)。
便捷阅读
356页 《使用Python的应用机器学习解决方案:使用前沿库和强大的统计技术创建可生产的机器学习项目》高清epub下载:
扫码添加云朵君微信,务必备注【AMLSWPY】![]()
🏴☠️宝藏级🏴☠️ 原创公众号『 数据STUDIO 』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括 可戳 👉 Python | MySQL | 数据分析 | 数据可视化 | 机器学习与数据挖掘 | 爬虫 等,从入门到进阶!
长按👇关注- 数据STUDIO -设为星标,干货速递