别把issue直接扔给AI——我踩过的三个坑和最终的提炼流程
先说常见的失败做法
GitHub issue是开源项目和团队协作里信息密度最低、噪音最高的地方之一。一个功能请求可能夹杂着三段环境描述、两段吐槽、一段复现步骤,最后一句才是真正的诉求。于是很多独立开发者和小团队想到了AI:让大模型帮忙读issue、提炼信息、生成摘要,听起来很美好。
但实际操作中,失败率出乎意料地高。我自己踩过的坑,归纳起来有三种:
坑一:直接全文粘贴,不做任何裁剪。 有人把issue连同几十条评论一起塞进对话框,然后问“帮我总结一下”。模型输出的结果往往是一份“面面俱到但什么都没说”的摘要——它把吐槽和正事等权重处理了,你读完还是不知道这个issue到底要什么。上下文越长,模型对关键信息的注意力越稀薄,这是大模型的通病。
坑二:指令太模糊。 “总结这个issue”这种提示词,等于把提炼标准完全交给模型猜。有一次我让AI总结一个关于内存泄漏的issue,它给我返回了一段技术科普——什么是内存泄漏、常见原因有哪些。信息没错,但完全不是我想要的。
坑三:让AI直接给结论,不要求引用原文。 AI在提炼长文本时会出现“合理脑补”:把用户的猜测总结成事实,把两个不同评论者的观点合并成一个人的。如果摘要里不标注信息来源,你拿着这份提炼结果去做决策,风险不小。
这三个坑的共同点是:把AI当成了一个“自动总结按钮”,而没有把它当成一个需要明确任务边界的分析工具。
正确路径:先定标准,再喂材料,最后要证据
调整思路后,我把流程改成了三步:
第一步,明确提炼目标。 在动用AI之前,先想清楚我要从issue里拿到什么。是用户的核心诉求?是可复现的bug步骤?还是版本兼容性问题的分布?目标不同,提示词完全不同。
第二步,预处理输入材料。 我会先用一个简单的脚本把issue正文和评论分开,标注评论者身份(维护者、报告者、路人),过滤掉纯表情、"+1"之类的无效评论。这一步不需要多复杂的代码,但能显著降低AI被噪音带偏的概率。
第三步,用结构化提示词要求“结论+证据”。 这是关键。我的提示词模板要求AI输出的每个结论都必须附带原文引用,并且明确区分“用户明确说的”和“推测的”。这样我拿到结果后,可以快速核对,避免被AI的脑补误导。
可复制的提示词模板
下面是我日常使用的模板,你可以直接复制,替换方括号里的内容:
你是一名技术项目助理,负责分析GitHub issue。请严格按照以下要求处理:
【输入材料】
Issue标题:[粘贴标题]
Issue正文:[粘贴正文]
相关评论:[粘贴评论,标注评论者身份]
【任务】
1. 提炼报告者的核心诉求(不超过3条),每条附带原文引用作为证据
2. 提取所有可复现步骤和关键环境信息(版本号、操作系统、依赖等)
3. 区分“用户明确陈述的事实”和“用户的猜测或推断”,分开列出
4. 如果存在多个评论者,分别标注各自的立场和关键信息
5. 指出信息缺口:如果要让维护者处理这个issue,还缺哪些必要信息
【输出格式】
- 核心诉求:(编号列表,每条带引用)
- 复现与环境:(结构化列表)
- 事实 vs 推断:(两个分区)
- 信息缺口:(列表)
- 一句话总结:(不超过50字)
【约束】
- 不得添加原文中没有的信息
- 引用必须是原文片段,不得改写
- 如果某项信息在原文中不存在,明确写“未提及”这个模板的核心设计是“结论必须有证据、缺失必须显式声明”。实践下来,AI脑补的问题基本消失了,因为“不得改写引用”这条约束把模型的发挥空间限制住了。
用AI前后的对比
用AI之前: 我处理一个有三十多条评论的issue,平均要花20到30分钟通读、划重点、判断哪些信息可信。遇到措辞混乱的报告,还得来回翻评论拼凑上下文。一天处理十几个issue,大量时间耗在了“找信息”而不是“解决问题”上。
用AI之后: 预处理脚本加上模板化提问,单个issue的信息提炼时间降到3到5分钟。更重要的是输出质量稳定——因为我要求区分事实和推断,还标注信息缺口,我拿到摘要后往往能直接判断:这个issue是缺少信息需要追问,还是信息齐全可以排期。有一次我从AI的“信息缺口”清单里发现报告者根本没提操作系统版本,一句追问就解决了来回三天的扯皮。
需要说明的是,AI并没有替代我去读原文,而是替代了“通读和定位”这个环节。关键决策仍然需要我核对引用后做出,但这已经是效率上的质变了。
几点补充建议
- 不同类型的issue用不同模板。 bug报告、功能请求、使用咨询,三者的提炼重点不同,值得分别维护模板。
- 预处理值得投入。 哪怕只是过滤无效评论和标注评论者身份,投入五分钟写脚本,换来的提炼质量提升远超预期。
- 控制输入长度。 超长讨论串建议分段提炼再汇总,两段式处理比一次性塞进去效果更好。
- 成本方面,这类任务对模型能力要求适中,中档模型通常够用,具体选型和费用以各平台官网价格页为准。
如果你在搭建自己的AI工作流时,需要一个稳定、可灵活切换多种模型的API服务,可以了解一下 Thistoken(https://api.thistoken.ai/register),统一网关接入,方便你在不同提炼任务之间快速对比和切换模型。
---
不想折腾多家供应商的接入差异?在 https://api.thistoken.ai/register 注册,用一个 base_url 调用所有模型。