如何使用Node.js爬取任意网页资源并输出PDF文件到(2)

日期：2020-11-30 栏目：程序人生浏览：次

TIPS: 本项目设计思想就是一个网页一个PDF文件，所以每次爬取一个单独页面后，请把index.pdf拷贝出去，然后继续更换url地址，继续爬取，生成新的PDF文件，当然，您也可以通过循环编译等方式去一次性爬取多个网页生成多个PDF文件。

对应像京东首页这样的开启了图片懒加载的网页，爬取到的部分内容是loading状态的内容，对于有一些反爬虫机制的网页，爬虫也会出现问题，但是绝大多数网站都是可以的

文件解构设计

如何使用Node.js爬取任意网页资源并输出PDF文件到

数据在这个时代非常珍贵，按照网页的设计逻辑，选定特定的href的地址，可以先直接获取对应的资源，也可以通过再次使用 page.goto方法进入，再调用 page.evaluate() 处理逻辑，或者输出对应的PDF文件，当然也可以一口气输出多个PDF文件~

这里就不做过多介绍了，毕竟 Node.js 是可以上天的，或许未来它真的什么都能做。这么优质简短的教程，请收藏
或者转发给您的朋友，谢谢。