paper-explainer · 科研论文解读

科研论文解读 skill:解析 arXiv/PDF 的公式与图表,提炼问题、贡献、方法、关键图与结论,再产出 B站/视频号解读视频或知乎/公众号图文。
核心中间产物是一份结构化 asset library(一次解析提炼,视频与图文两条产线共用)。提炼要求忠于原文:不夸大、不编造结论,拿不准处标注。视频产线含分镜脚本、稳定 slide 渲染产线、配音字幕合成,缺一不可。
调用示例:在聊天框中说"把这篇 arXiv 论文讲成一条 3 分钟的视频号视频"。
产品详解
定位
paper-explainer 是"论文 → 大众可看的视频/图文"的内容产线:从论文做内容。视频转图文(反向)用 video-to-article,纯格式转换只用 doc-convert。
核心能力
- 论文解析:拉取 arXiv/本地 PDF,用 MinerU(含公式/图表结构化,需 token)或 pdfplumber(纯文本 + 尽力抽图)解析。
- 结构化提炼:一句话讲清干了啥、问题与已有不足、贡献(≤3 条)、方法(含通俗类比)、关键图(2–4 张,每张大白话解释)、关键数字结果、局限、结论、术语通俗表。
- 一次提炼两处复用:asset-library.json 是唯一真相源,视频与图文产线共用,不重复调 LLM、不口径不一。
- 视频产线:分镜脚本(钩子→问题→不足→贡献→方法→结果→意义)→ 稳定 slide 产线(分页校验/渲染/审计,文字不越界不重叠)→ 配音 + 字幕 + 合成(单人 tts-voiceover 或双人问答 multi-voice-dubbing)。
- 图文产线:同一份 asset library 写成知乎/公众号文章(知乎逻辑链、公众号起承转合)。
工作流程
- 取原文 + 解析(环境自检 → 拉论文 → 解析)
- 结构化提炼,填满 asset-library.json(忠于原文,不夸大不编造)
- 视频产线:分镜脚本 → slide 渲染产线(validate/render/audit)→ 配音字幕合成 → 成片
- 图文产线:同一份 asset library 写成文章
输入与输出
| 输入 | 说明 |
|---|---|
| 论文 | 必填,arXiv id / arXiv 链接 / 本地 PDF 路径 |
| 目标形态 | 选填,视频(默认,视频号/B站)/ 图文(知乎/公众号)/ 两者都要 |
| 视频画幅 | 视频时必填,横版/竖版须用户确认,不做默认推断 |
| 受众深度 | 选填,大众科普(默认)/ 同行向 |
| 时长 | 选填,视频默认 2–4 分钟 |
输出(outputs/论文简称/):article.md 图文版、final.mp4 成片、assets/(原 PDF、解析结果、asset library、分镜脚本、slides)。
与相邻 skill 的区别
| skill | 分工 |
|---|---|
| paper-explainer(本) | 从论文做视频/图文内容 |
| video-to-article | 从视频做图文(反向) |
| doc-convert | 只转换文档格式 |
| skill-channels-upload | 发视频号(发布环节) |
适用场景
- 科研工作者/科普博主把论文讲成大众视频
- 学术成果的图文解读(知乎/公众号)
- 一次解析同时产出视频与图文两种形态
使用前准备
- 准备 arXiv id/链接或本地 PDF;MinerU 结构化解析需自备 API token,否则用 pdfplumber 纯文本解析。
- 视频画幅须在制作前明确确认;受众深度影响讲解的专业程度。
- 学术内容忠于原文是硬规则:术语拿不准先查原文,不臆测。
paper-explainer 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。