这 10 个 Python 付费 app 平替工具,码住!
办公室里最不值钱的一笔订阅费,不是贵,是你一年到头只用了它一个按钮。
PDF 合并、扫描件转文字、表格清洗、批量压图、网页上重复点导出……这类活,我一般不急着装软件,先看它是不是“固定输入、固定步骤、固定输出”。只要是,八成就能用 Python 顶掉。像 Acrobat、ABBYY 这种常见付费工具,核心卖点无非就是 PDF 编辑、转换、OCR;RPA 和流程自动化那边,UiPath、Zapier 也是把重复动作封成流程。Python 这边并不缺轮子:PyMuPDF 能处理 PDF,PaddleOCR 能识别文字,pandas 和 openpyxl 读写表格很稳,Pillow 处理图片,Playwright 负责浏览器自动化。
我把平时最常替掉的 10 类活,直接摊开说。
1. PDF 合并、拆分、抽页平替掉的大多是 PDF 工具里最常点的那几个按钮。合同汇总、发票抽首页、批量拆单页,PyMuPDF 够用了。它本身就支持提文本、搜文本、合并 PDF,不少人还在手工点菜单。
from pathlib import Path
import fitzsrc_dir = Path("待处理pdf")
out_dir = Path("输出")
out_dir.mkdir(exist_ok=True)
merged = fitz.open()
for pdf_path in sorted(src_dir.glob("*.pdf")):
doc = fitz.open(pdf_path)
merged.insert_pdf(doc)
first_pages_text = []
for i in range(min(2, doc.page_count)):
first_pages_text.append(doc.load_page(i).get_text("text"))
if"发票"in"\n".join(first_pages_text):
one = fitz.open()
one.insert_pdf(doc, from_page=0, to_page=0)
one.save(out_dir / f"{pdf_path.stem}_首页.pdf")
one.close()
doc.close()
merged.save(out_dir / "总包.pdf")
merged.close()
2. 扫描件 OCR很多人买 OCR 软件,最后就干一件事:把图片里的字抠出来。发票、合同、纸质表单,PaddleOCR 这类工具本来就是干这个的。
3. Excel 清洗这块最适合用脚本。去重、补空值、手机号脱脏、状态筛选、按条件拆多个表,pandas 读数据,openpyxl 负责落回 xlsx,基本就是流水线。pandas 官方文档里本来就把缺失值、IO、表格处理当主场景;openpyxl 也是直接面向 xlsx 读写。
import pandas as pddf = pd.read_excel("客户台账.xlsx", dtype=str).fillna("")
df.columns = [c.strip() for c in df.columns]
df["手机号"] = df["手机号"].str.replace(r"\D+", "", regex=True)
df["成交金额"] = pd.to_numeric(df["成交金额"], errors="coerce").fillna(0)
df = df[df["订单状态"] != "作废"]
df = df.drop_duplicates(subset=["订单号"], keep="last")
df["客户级别"] = df["成交金额"].apply(lambda x: "重点跟进"if x >= 10000else"普通")
df.to_excel("客户台账_清洗后.xlsx", index=False)
4. 对账单、日报、周报自动生成不少“报表软件”真没多神,底层还是读数据、算字段、导 Excel、画图。数据不大时,pandas 加 matplotlib 就够干活。
5. 图片压缩、改尺寸、转格式、加水印运营经常要批量出图,这种反复横跳最烦。Pillow 支持的格式很多,缩略图、裁剪、压缩、拼图都能写。
6. 文件批量重命名、归档、打包这类事最不值得买软件。Python 标准库里的 pathlib、shutil、zipfile 足够把“按日期归档、按规则改名、打 zip 包”整明白。
7. 网页重复点击、登录、下载导出后台每天点 20 次“查询-导出-下载”,我一般先怀疑这事是不是根本不该靠人手点。Playwright 本来就是拿来驱动浏览器的,支持 Chromium、Firefox、WebKit,拿它替掉一批轻量 RPA 很顺手。
from pathlib import Path
from playwright.sync_api import sync_playwrightdownload_dir = Path("导出文件")
download_dir.mkdir(exist_ok=True)
with sync_playwright() as p:
browser = p.chromium.launch(headless=True)
page = browser.new_page()
page.goto("https://erp.example.com/login")
page.fill("#username", "report_bot")
page.fill("#password", "你的密码")
page.click("button[type=submit]")
page.goto("https://erp.example.com/order/report")
page.click("text=今天")
with page.expect_download() as d:
page.click("text=导出Excel")
d.value.save_as(download_dir / "订单日报.xlsx")
browser.close()
8. 定时跑任务每天 9 点拉接口、每周一汇总数据、每晚备份文件,这种小调度没必要上重平台。schedule 这种轻量库就够了。
9. CSV、日志、文本清洗线上日志筛关键字、把 CSV 转成标准字段、清掉脏字符,这些都属于 Python 的舒适区。标准库 csv 就是为这种表格文本处理准备的。
10. 批量邮件和附件发送很多“邮件助手”说到底就是模板替换加 SMTP 发送。Python 自带 smtplib 和 email,日报、催办、附件通知都能自己接起来。
别误会,付费 app 不是不能买。真到了多人协作、权限审计、审批流、非技术同事也要一起用的时候,买现成产品很正常。
但只是一个人天天重复点鼠标,真没必要把体力活包装成订阅费。能写成规则的事,就尽量别再靠手点。先上 Python,真顶不住了,再掏钱。