用python5分钟搞定精美的PDF文档

绍

Pandas非常善于处理大量数据并在多个文本和可视化表示中对其进行汇总。支持输出到CSV，Excel，HTML，json等。如果想将多个数据组合到一个文档中，那么会有点困难。例如，如果要在一个Excel工作表上放置两个DataFrame，则需要使用Excel库手动构建输出。

5分钟教您用python生成精美的PDF文档

本文将介绍如何将多条信息组合成一个HTML模板，然后使用和将其转换为精美的PDF文档。

下面看看生成的PDF效果吧:

5分钟教您用python生成精美的PDF文档效果

过程

使用Pandas将数据输出到Excel文件中的多个工作表或从pandas DataFrames创建多个Excel文件非常方便。但是，如果您想将多个信息组合到一个文件中，那么直接从Pandas完成它的方法并不多。幸运的是，python有很多工具可以办到。

在本文中，将使用通过以下流程来创建多页PDF 文档。

将使用通过以下流程来创建多页PDF 文档

这种方法的好处在于您可以将自己的工具替换为此工作流程。如果您想在HTML之外使用其他类型的标记，请选择Jinja。

工具

首先，使用HTML作为模板语言，因为它可能是生成结构化数据并允许相对丰富的格式化的最简单方法。每个人都知道（或可以弄清楚）足够的HTML来生成一个简单的报告。最困难的部分是弄清楚如何将HTML呈现为PDF。选择了WeasyPrint，相对而言是最佳解决方案，因为它仍在积极维护，可以相对容易地使用它。另外效果也很好。遗憾的是，此时文档有点缺乏，确实可以从HTML生成PDF。

数据

下面是导入数据并生成数据透视表以及CPU和软件销售的平均数量和价格的一些汇总统计数据。

导入模块，并读入销售渠道信息。

from __future__ import print_function
import pandas as pd
import numpy as np
df=pd.read_excel("sales-funnel.xlsx")
df.head()

透视数据进行总结。

sales_report=pd.pivot_table(df, index=["Manager", "Rep", "Product"], values=["Price", "Quantity"],
 aggfunc=[np.sum, np.mean], fill_value=0)
sales_report.head()

生成有关整个数据集的一些总体描述性统计信息。在这种情况下，我们希望显示CPU和软件销售的平均数量和价格。

print(df[df["Product"]=="CPU"]["Quantity"].mean())
print(df[df["Product"]=="CPU"]["Price"].mean())
print(df[df["Product"]=="Software"]["Quantity"].mean())
print(df[df["Product"]=="Software"]["Price"].mean())
1.88888888889
51666.6666667
1.0
10000.0

理想情况下，现在要做的是通过经理分组汇总数据，并在页面上包含一些摘要统计数据，以帮助理解单个结果与全国平均值的比较。

DataFrame选项

幸运的是，DataFrame有一个 to_clipboard() 将整个DataFrame复制到剪贴板的功能，然后您可以轻松地将其粘贴到Excel中。

稍后将在模板中使用的另一个选项是 to_html() 生成包含一个应用了最小样式的完全组合的HTML表。

模板

Jinja模板功能非常强大，支持许多高级功能，例如沙盒执行和自动转义，这些都不是此应用程序所必需的。但是，随着您的报告变得越来越复杂或您选择将Jinja用于您的网络应用，这些功能将为您提供良好的服务。

Jinja的另一个不错的功能是它包含多个，这些允许我们以Pandas中难以做到的方式格式化我们的一些数据。

为了在应用程序中使用Jinja，需要做三件事：

· 创建一个模板

· 将变量添加到模板上下文中

· 将模板渲染为HTML

这是一个非常简单的模板，称之为myreport.html ：

<！DOCTYPE html> 
< html > 
< head lang="en" > 
 < meta charset="UTF-8" > 
 < title > {{title}} </ title > 
</ head > 
< body > 
 < h2 >销售漏斗报告 - 国家</ h2 >
 {{national_pivot_table}}
</ body > 
</ html >

这段代码的两个关键部分是 {{ title }} 和 {{ national_pivot_table }} 。它们本质上是我们在呈现文档时将提供的变量的占位符。

要填充这些变量，需要创建一个Jinja环境并读取模板：

from jinja2 import Environment, FileSystemLoader
env=Environment(loader=FileSystemLoader('.'))
template=env.get_template("myreport.html")

在上面的示例中,假设模板位于当前目录中。

另一个关键组件是创建 env 。这个变量是我们将内容传递给模板的方式。我们创建一个名为的字典template_var ，其中包含我们想要传递给模板的所有变量。

请注意变量的名称如何与模板匹配。

template_vars={"title" : "Sales Funnel Report - National",
 "national_pivot_table": sales_report.to_html()}

最后一步是使用输出中包含的变量呈现HTML。这将创建一个我们最终将传递给PDF创建引擎的字符串。

html_out=template.render(template_vars)

为简洁起见，我不会显示完整的HTML，但您应该明白这一点。

生成PDF

该PDF创建部分比较简单为好。我们需要进行一些导入并将字符串传递给PDF 生成器。

from weasyprint import HTML
HTML(string=html_out).write_pdf("report.pdf")

此命令创建一个类似于以下内容的PDF报告：

啊。很酷，它是一个PDF，但它很难看。主要问题是没有加入任何css样式。

对于本文的其余部分，将使用blue print的作为的style.css的基础，如下所示。这个CSS的是：

· 它相对较小且易于理解

· 它可以在PDF引擎中运行而不会抛出错误和警告

· 它包括看起来相当不错的基本表格式

让我们尝试使用我们更新的样式表重新渲染它：

HTML(string=html_out).write_pdf(args.outfile.name, stylesheets=["style.css"])

只需添加一个简单的样式表就会产生巨大的差异！

更复杂的模板

为了生成更有用的报告，将结合上面显示的摘要统计信息以及分析报告，以便为每个经理包含一个自己单独的PDF页面。

让我们从更新的模板（myreport.html）开始：

<！DOCTYPE html> 
< html > 
< head lang="en" > 
 < meta charset="UTF-8" > 
 < title > {{title}} </ title > 
</ head > 
< body > 
< div class="容器" > 
 < h2 >销售漏斗报告 - 国家</ h2 >
 {{national_pivot_table}}
 {％include"summary.html"％}
</ div > 
< div class="container" >
 {％为经理在Manager_Detail％}
 < p style="page-break-before：always" > </ p > 
 < h2 >销售渠道报告 - {{manager.0}} </ h2 >
 {{manager.1}}
 {％include"summary.html"％}
 {％endfor％}
</ div > 
</ body > 
</ html >

你会注意到的第一件事是有一个 include 声明提到了另一个文件。这 include 允许引入一段HTML并在代码的不同部分中重复使用它。在这种情况下，摘要包含希望包含在每个报告中的一些简单的国家级统计数据，以便管理人员可以将其绩效与全国平均水平进行比较。

这是summary.html的样子：

< h3 >国家概要：CPU </ h3 > 
 < ul > 
 < li >平均数量：{{CPU.0 | round（1）}} </ li > 
 < li >平均价格：{{CPU.1 | round（ 1）}} </ li > 
 </ ul > 
< h3 >国家摘要：软件</ h3 > 
 < ul > 
 < li >平均数量：{{Software.0 | round（1）}} </ li > 
 < li >平均价格：{{Software.1 | round（1）}} </ li > 
 </ ul >

在此代码段中，您将看到我们可以访问的其他变量： CPU 和 Software 。其中每个都是一个python列表，其中包括CPU和软件销售的平均数量和价格。

您可能还注意到我们使用管道 | 将 round 每个值用于1位小数。这是使用Jinja过滤器的一个具体示例。

还有一个for循环，允许我们在报告中显示每个经理的详细信息。Jinja的模板语言只包含一小部分改变控制流的代码。基本for循环几乎是任何模板的支柱，因此它们应该对大多数人有意义。

我想调出一段看起来有点不合适的最后一段代码：

< p style="page-break-before：always" > </ p >

这是一个简单的CSS指令，我把它放在每个页面上以确保CSS中断。

额外的统计数据

现在已经完成了模板，这里是如何创建模板中使用的其他上下文变量。

这是一个简单的汇总函数：

def get_summary_stats(df,product):
 """
 For certain products we want National Summary level information on the reports
 Return a list of the average quantity and price
 """
 results=[]
 results.append(df[df["Product"]==product]["Quantity"].mean())
 results.append(df[df["Product"]==product]["Price"].mean())
 return results

还需要创建经理详细信息：

manager_df=[]
for manager in sales_report.index.get_level_values(0).unique():
 manager_df.append([manager, sales_report.xs(manager, level=0).to_html()])

最后，使用以下变量调用模板：

template_vars={"title" : "National Sales Funnel Report",
 "CPU" : get_summary_stats(df, "CPU"),
 "Software": get_summary_stats(df, "Software"),
 "national_pivot_table": sales_report.to_html(),
 "Manager_Detail": manager_df}
# Render our file and create the PDF using our css style file
html_out=template.render(template_vars)
HTML(string=html_out).write_pdf("report.pdf",stylesheets=["style.css"])

让python改变生活!如果满意上面的生成PDF讲解，点赞和评论。

获取文中代码请微信关注 "python_dada"公众号，输入“精美PDF”获取。

文概要

Part one: 可视化库cutecharts基本使用介绍

Part two: 爬取中国电竞价值排行榜-外设排行榜，利用cutecharts数据可视化分析

Part three: 总结抒情

Part one : 可视化库cutecharts基本使用介绍

1.cutecharts 安装

最简单的肯定是 pip? ?安装：

$ pip3 install cutecharts

当然，也可以进行源码安装：

$ git clone https://github.com/chenjiandongx/cutecharts.git
$ cd cutecharts
$ pip3 install -r requirements.txt
$ python3 setup.py install

如果是渲染成html文件，你还需要安装的第三方辅助库? ?jinja2? ?，是基于Python的模板引擎，主要用于渲染可视化后的内容，最终形成可运行的html文件，当然，如果你不感兴趣，你不用过多了解，在安装cutecharts时会自动帮你安装上，但你得知道它是unicode编码，稍不注意，可能模板生成错误。

解决方法其实很简单，我们把渲染页面里的js脚本单独拿出来，放到js文件内，然后再在html页面内加载静态的js文件即可，说白了，就是不要让jinja2直接去渲染‘有问题’的js内容。

如果你嫌这个麻烦，还有一位朋友使用静态加载方法解决了该问题。

<script type="text/javascript" src="{{url_for('static',filename='js/echarts-gl.min.js')}}"></script>

当然，没有遇到问题最好～我是直接用的jupyter notebook，所以没有这个问题。

关于jupyter notebook安装使用，你可以看我之前分享的文章：Windows/Mac 安装、使用 Python 环境 +jupyter notebook

2.基本使用

目前cutecharts支持的可视化图像类型有：柱状图、折线图、饼状图、雷达图、散点图。我想后续作者还会增加的，比如：词云图、3D柱状图、条形图等等。另外，项目里已经给我们提供了测试用例，所以我们学习的时候就不用再去自己写测试用例了，直接调用即可。

First : 柱状图

# 导入cutecharts中的Bar
from cutecharts.charts import Bar
# 导入测试用例
from cutecharts.faker import Faker


def bar_base() -> Bar:
    chart=Bar("Bar-基本示例")
    chart.set_options(labels=Faker.choose(), x_label="I'm xlabel", y_label="I'm ylabel")
    chart.add_series("series-A", Faker.values())
    return chart


bar_base().render_notebook()

渲染引擎提供了两个

.render(html_name) ：生成一个本地文件，html_name为文件名（html文件）,
默认名为：render.html
.render_notebook() ：可以在jupyter中直接运行显示，如上文代码
本文案例代码都是在Jupyter Notebook上编写运行

显示情况：