PRD · 产品需求文档

网页版文学大模型

解决现有 LLM 无法具备"人类共识文学生成能力"的问题,产出能通过图灵检测、并获得专家团一致性认可的作品。

版本 v0.2(评审稿) 日期 2026-08-23 作者 shikunpunk 状态:待评审

00文档说明与产品关系

0.1 修订记录

版本日期主要修订
v0.12026-08-20初稿
v0.22026-08-23① 新增本文档说明与产品关系、修订记录;② 市场叙事改为"能力空白 + 早期实践者",新增竞品分析(3.4);③ 验收标准改为可测口径:AC-1 明确盲测形式与随机基线、AC-4 改为"会话累计成书"、AC-5 给出具体指标;④ MVP 阶段一前置风格评测体系并论证顺序(5.2);⑤ FR-2 更名"创作过程透明化"并降级 P1,说明与社区反馈的冲突解法;⑥ 新增 FR-4 网页产品基础功能;⑦ 新增专家团定义(4.2);⑧ 埋点补齐事件定义规范与隐私合规(8.0 / 8.5);⑨ 明确开源范围与许可边界(9.1);⑩ 风险表补齐"图灵检测失败兜底"与"在世作家版权";⑪ 里程碑增加建议排期,新增商业模式(9.3)

0.2 与现有产品的关系

本项目不是从零开始的新产品,而是现有 AI 创作生态中文学引擎能力 + 评测体系的部分。为保密需要,本节不涉及任何具体产品名称,仅以抽象层级描述关系:

层级定位与本项目的关系
平台层(现有 AI 创作平台)面向创作者的创作与内容分发平台,承载小说 / 诗歌 / 电影等创作引擎本项目是其文学引擎的技术底座,研究成果直接注入平台
产品层(独立商业化产品)面向特定创作场景的独立产品,闭源商业运营基于本项目引擎构建,产品源码不在开源范围(见 9.1)
本项目(网页版文学大模型)模型能力 + 评测体系 + 开源生态(模型权重 / 代码 / 评测基准)本文档定义其目标、范围、验收与交付物

关系结构:平台层承载产品层,产品层基于本项目引擎构建,本项目引擎独立开源;三层解耦、各自演进。研究产出优先注入平台层,产品层以订阅 / API 方式商业化,本项目以开源方式回馈社区。

01项目背景与定位

当前大语言模型在 代码生成(AI for Coding)数学推理(AI for Math) 领域已形成成熟能力与规模化产品;与之相比,文学创作是能力空白:现有模型生成的文本普遍带有"AI 味",缺乏人类共识认可的文学生成能力,更无法产出通过图灵检测的作品。

我们不是这个空白市场的旁观者,而是早期实践者:自有 AI 创作平台已累计辅助创作 100 万+ 字,覆盖小说、诗歌、电影三大创作引擎,验证了需求的真实性;自研诗人风格模型家族(26 个开源模型)与"诗性"自动评测指标(与人类一致性 Kappa 0.9557)已沉淀为可复用资产。本项目在此基础上,集中攻坚文学创作能力的两个纵深:长文本 / 超长文本生成,与稳定风格生成。

项目定位:构建一个网页版文学大模型,以文学创作能力为核心竞争力,在文本生成长度、风格稳定性、人类共识认可度三个维度上突破现有上限,并将能力开源回馈社区。

核心命题:文学不只是语言表层拟合。它要求核心意象贯穿、风格分期锚定、叙事克制、时代细节真实,以及能引发人类共情的"思想闪光"——这正是本项目要攻克的技术纵深。

02目标与验收标准

2.1 项目目标

2.2 验收标准

v0.2 起全部改为可测口径;标注"建议值"处待专家团与评审确认。

编号验收维度验收标准测量方式
AC-1图灵检测 v0.2 修正二选一双盲测:每篇作品与一篇人类作品配对,标注者判断"哪篇是人写的"。通过标准:判断正确率 ≤ 52%(随机基线 50%,须落在随机波动区间内且不可区分,双侧检验 p > 0.05)双盲 A/B 测试,样本 ≥ 200 篇,标注者非本项目成员
AC-2专家团一致性 v0.2 修正专家团(≥ 9 人,构成见 4.2)独立评分:≥ 2/3 认为作品"具有文学价值且无明显 AI 味";且专家间评分一致性 Kappa ≥ 0.6四维评分(意象 / 结构 / 语言 / 情感)+ 一致性检验
AC-3长文本能力单次生成 ≥ 5,000 字,主题、人物、核心意象贯穿不散架自动连贯性指标 + 人工抽查
AC-4超长文本能力 v0.2 修正单会话累计生成 ≥ 30,000 字成书(大纲 → 分章 → 续写),章节结构完整,无死循环 / 重复生成;口径与 FR-1 一致,不要求"单次输出 3 万字"端到端成书测试(大纲 + 分章 + 续写全链路)
AC-5风格稳定度 v0.2 修正同风格多次生成,基于自研64 维特征库(37 维最优组合)的特征向量余弦相似度 ≥ 0.85(建议值)离线评测,复用自研诗性评测特征体系
AC-6异常率截断率 < 1%,循环思考 / 重复生成 < 0.5%,异常 100% 可追溯依赖第 8 章埋点系统上线后统计

03市场压力与用户反馈

3.1 能力缺口

市面已有成熟的 AI for CodingAI for Math 产品,而文学创作仍无成熟能力:通用模型输出普遍"AI 味儿太浓",缺乏专门面向文学的深度优化。这是能力缺口,也是我们的机会窗口——我们已是这一方向的早期实践者。

Coding
代码生成 · 已成熟
Math
数学推理 · 已成熟
Literature
文学创作 · 能力空白 · 我们在场

3.2 用户反馈数据分析(已脱敏)

反馈数据来源于 E:\用户反馈.txt,样本构成:专家团评审 2 轮(余华风格仿写莫言《透明的红萝卜》)与社区评论约 40 条(海子诗歌生成 v1 / v2 评论区),均已去除用户名与个人身份信息后分析。

负面问题聚类("AI 味"的具体病灶)

#问题聚类典型反馈摘录(脱敏)影响环节
1风格不分期锚定"余华存在明显的创作分期……需先明确锚定模仿的是哪一阶段的余华"风格控制
2核心意象未贯穿"透明的红萝卜更像一个标签,没有成为驱动叙事、承载感知的核心"长文结构
3文风混杂、调性割裂"先锋式冷感和温情叙事交替出现,整体调性割裂"风格稳定
4叙事冗余、心理直给"尽量少直接交代人物心理,多用动作、场景暗示情绪,减少直白抒情"生成质量
5时代性 / 物象细节错误"绍兴黄酒"与"每日两碗白米饭"不符合时代语境,产生违和感知识对齐
6环境描写铺排失焦"环境描写是铺排上去的,多但不详细,真实感降低,喧宾夺主"生成质量
7长篇架构破碎"如果是全部的话,这个故事架构好像有点破碎"超长文本
8语言表层化"句式过于白话、修辞极度简单,意象化、跳跃和含混的特征十分不足"文学性
9意象拼接、碎片化"拼接高频词 / '海子尸块拼盘',句式结构气质与本人无关"文学性
10平均化、可预测"能知道它想写什么,算是一种平均化了的诗,不跳脱"文学性
11思维链僵硬"人的诗是直接性的……思维链式考究是诗歌的反面"产品设计
12缺乏思想深度与共情"很难挑出一两句让人眼前一亮从而内心感动的句子,难以引人共情"文学性

正面信号(方向验证)

#正面信号结论
1"至少形是像了";v2(27B+KTO)显著优于 v1(3B)验证 模型规模 → 风格逼近 的路线可行
2环境反衬手法被认可("用环境描写反衬黑孩的真实处境")部分文学手法已达标
3"把已写过的母题用另一种风格重写,可扩充人类文学"验证 文学工业化 方向(重写母题而非替代人类)
4"尽量挖掘已故文人,风格固定,可见性强"对外风格对象建议聚焦已故作家
5"可用知网核心期刊论文喂 AI 总结理解风格"风格学习可引入学术语料

反馈情绪分布 v0.2 补样本量

分母为社区评论 40 条(专家评审 2 轮不计入情绪统计),同一评论可同时归入多类。

负面反馈
26 条 · ≈ 65%
正面 / 中立
10 条 · ≈ 25%
建议类
4 条 · ≈ 10%

结论:负面集中于文学性(意象、风格、思想深度),即"AI 味"的本质;这决定了下文 MVP 中"风格评测体系前置"的安排。

3.3 反馈 → 需求映射

反馈问题映射需求
风格混杂、不分期、意象拼接FR-3 风格融合(分期锚定 / 意象贯穿 / 风格指纹)
叙事冗余、心理直给、环境铺排FR-1 生成能力(叙事克制、详略控制)
长篇架构破碎、时代细节错误FR-1 长文本 / 超长文本生成 + 知识对齐
思维链僵硬FR-2 创作过程透明化(草稿笔记,非强制推理)
平均化、缺闪光句纳入 G2 验收与专家团盲测,作为长期研究课题

3.4 竞品分析 v0.2 新增 · 本次扩充

按"通用大模型写作 / 写作辅助 / 小说生成 / 诗歌生成 / 网文工具"五类梳理竞品:

类别代表现状我们的差异
通用大模型写作Claude / GPT / DeepSeek / 豆包 / 文心文学是附带能力,非优化重点;长文易散、风格混杂、意象拼接,普遍"AI 味"专注文学单一场景;自研诗人 / 小说家风格模型 + 长文成书链路
AI 写作辅助工具Sudowrite、阅文"妙笔"等国内平台偏英文创作(Sudowrite);或为营销文案 / 公文模板生成,不涉严肃文学以"文学共识认可"为 KPI(图灵检测 + 专家团盲测),而非模板产出
AI 小说生成平台NovelAI 等偏设定 / 插画增强,长文本叙事连贯性一般超长文本成书(≥3 万字会话)+ 可视化剪辑工作台
诗歌生成工具古诗 / 词牌 / 现代诗小程序格律模板拼接,无语义深度与风格内核风格微调模型 + 诗性自动评测 + Hard 难样本集
网文类型化写作工具起点系写作插件 / 大纲工具大纲 / 查重 / 灵感,不生成"有作者风格"的正文多 Agent 创作集群 + 稳定风格指纹 + 母题重写能力

结论:竞品普遍在"风格稳定性"与"专家认可的文学性"两个维度缺位,这正是本项目的核心壁垒与差异化所在。

04用户画像与专家团

4.1 用户画像

用户画像特征典型使用场景核心诉求
AI Builder 算法 / 工程背景的技术人员 评测模型文学能力边界、参与开源迭代、跑基准测试 可复现、可评测、创作过程可视化
Writer(创作者) 文学写作者、风格研究者 风格化仿写、已故作家母题重写、长篇小说辅助创作 稳定风格、长文连贯、可续写可编辑
Reader(文学读者) 文学爱好者 阅读 AI 文学作品、给出反馈 作品可读性、无 AI 味、价值认可
评审专家(专家团成员) 文学教授 / 作家 / 资深编辑 盲测、四维评分、风格评审 流程规范、可追溯、有署名与激励

4.2 专家团定义 v0.2 新增

维度定义(建议值)
人数≥ 9 人(奇数,便于表决),常态 9–12 人
构成高校文学专业教授 / 副教授 ≥ 3;在职作家 / 诗人 ≥ 3;资深编辑 / 文学评论人 ≥ 3
招募渠道自有创作平台社区创作者、高校文学系合作、文学期刊与出版社编辑网络
激励评审署名鸣谢、按轮次评审稿酬(或等价权益)、产品内测与模型试用权
评审流程① 双盲配对(人 / AI 二选一)→ ② 四维独立评分(意象 / 结构 / 语言 / 情感,各 1–5 分)→ ③ 一致性检验(Kappa ≥ 0.6 视为有效评审轮)→ ④ 汇总出报告
避嫌规则评审成员不得参与本项目的模型训练与标注,杜绝既当运动员又当裁判

05最小实现范围(MVP)

5.1 阶段划分

阶段 一
长文本 & 超长文本生成 + 风格评测体系

≥5,000 单次 / ≥30,000 会话累计成书;同步搭建风格指纹评测(复用 64 维特征库),作为阶段二与 G2 的验收工具。

阶段 二
稳定风格生成与风格融合

分期锚定、风格指纹达标、母题重写能力。

5.2 为什么"先长度、后风格" v0.2 新增论证

反馈数据显示用户最痛的是"AI 味"(风格 / 文学性),但工程上仍先做长度,原因:

5.3 明确不做(本期)

范围状态说明
多风格即时切换不做与"单一稳定风格"(阶段二)的边界:本期一个作品只锚定一种风格,不做"生成中实时换风格"
通用问答 / 知识助手能力不做聚焦文学创作单一主场景
多模态(插图 / 语音)不做纯文本创作
关键依赖:算法能力(长上下文注意力、风格控制算法)与算力硬件(推理与微调资源,成本预算见 10.1)。两者不足时,MVP 范围不得扩张。

06功能需求

6.1 生成能力

FR-1长文本 / 超长文本生成 P0 · 必须
  • 生成口径(v0.2 统一)单次生成 ≥ 5,000 字单会话累计 ≥ 30,000 字成书,由"大纲 → 分章 → 续写"链路完成,与 AC-4 一致;
  • 长文主题、人物、核心意象贯穿始终,不因长度增加而散架;
  • 章节 / 段落结构完整,支持"续写 / 改写 / 插入"等二次编辑;
  • 叙事克制:少直接交代人物心理,多用动作、场景、细节暗示情绪;
  • 环境描写少而精:数量收敛、细节加深,避免铺排与喧宾夺主;
  • 时代性 / 物象知识对齐:内置时代物象知识库(或检索增强),避免"绍兴黄酒"类错误。

6.2 创作过程透明化

FR-2创作过程透明化(原"展示思维链") P1 · 重要(阶段一)

社区反馈明确批评"思维链式考究是诗歌的反面"。v0.2 据此重新定义本需求——展示"创作笔记",而非强制推理日志

  • 生成过程中以"创作笔记"形式展示:风格锚定说明、意象草案、情节走向、打磨痕迹,呈现"草稿 / 直觉 / 打磨"感;
  • 笔记可开关:用户可选择只看成品或过程全览;
  • 不进入生成主路径:展示层不强制模型"逐条推理",避免破坏文学的直接性(回应反馈问题 11);
  • 笔记数据同时作为异常诊断来源(检测循环思考、重复生成),并回流埋点(见第 8 章)。

6.3 风格融合

FR-3稳定风格生成与风格融合 P1 · 重要(阶段二)
  • 风格分期锚定:同一作家的不同创作分期视为不同风格对象,须显式指定(如余华·先锋期 / 温情期);
  • 核心意象贯穿:选定意象须成为驱动叙事、承载感知的核心,而非标签;
  • 风格指纹稳定:同风格多次生成,64 维特征(37 维组合)余弦相似度 ≥ 0.85(对应 AC-5);
  • 母题重写:支持"已写过的题目 / 母题以目标风格重写",作为文学工业化的核心场景;
  • 合规边界(v0.2 新增):对外风格对象限于已故作家(版权进入公有领域或已获授权);在世作家(含余华)仅用于内部评测,不对外提供风格化服务,不发布仿写作品;
  • 风格学习语料可引入知网核心期刊研究论文等学术资料辅助理解风格内核。

6.4 网页产品功能 v0.2 新增

FR-4网页版产品基础功能 P0 · 必须
  • 账号与鉴权:注册 / 登录 / 会话管理,支持匿名试用与实名账号;
  • 作品管理:作品保存、历史版本、恢复、删除、数据导出(Markdown / PDF / LaTeX);
  • 创作交互:流式输出与生成进度可见、续写 / 改写 / 插入 / 大纲编辑;
  • 分享发布:作品可生成只读分享链接(AI 生成显著标注);
  • 反馈入口:作品级点赞 / 点踩与评语,接入第 8 章埋点。

6.5 需求优先级汇总(MoSCoW)v0.2 修正

优先级需求阶段
MustFR-1 长文本 / 超长文本生成、FR-4 网页产品功能、NFR-1 异常记录、埋点、专家团盲测面板(v0.2 上调)阶段一
ShouldFR-2 创作过程透明化、FR-3 稳定风格生成、风格指纹评测阶段一(FR-2)/ 阶段二(FR-3)
Could风格对比工具、多人在线协作创作阶段二(有余力)
Won't多风格即时切换、多模态、知识问答本期不做

07非功能需求

NFR-1异常记录与可观测性 P0 · 必须

对以下五类异常全量记录、可追溯、可告警

异常类别定义记录内容处置
截断达到输出上限 / 上下文窗口导致文本被切断触发位置、长度、上下文占比提示续写 / 自动分段重生成
超时 / 网络单次生成超过时限或网络中断耗时、重试次数、失败阶段重试 + 进度可见
循环思考推理链出现重复回路,无进展循环起点、重复片段熔断并回退到上一稳定输出
重复生成输出出现段落级重复 / 车轱辘话重复片段定位自动检测 + 人工标记
违法违规内容违反法律法规或平台安全规范触发策略类别、拦截动作内容安全过滤(生成前 / 后双闸)
  • 异常日志含请求 ID 全链路追踪(入参 → 生成 → 输出 → 用户反馈);
  • 异常指标 实时监控 + 阈值告警,并进入周报复盘;
  • 禁止记录原始敏感个人信息,日志符合脱敏要求(详见 8.5)。

其他非功能要求 v0.2 修正

维度要求
性能流式输出首 token 延迟 < 3s;单次 5,000 字生成 ≤ 5 分钟(RTX 4060 量级,建议值待实测);30,000 字成书会话 ≤ 60 分钟(建议值待实测)
可用性内测期目标 ≥ 99%,不承诺 SLA;故障降级为"长文回退模式"——超长生成失败时自动降级为"大纲 + 分章逐段生成",保证进度不丢失(定义补充)
安全提示词注入防护、生成内容合规过滤、鉴权与限流
合规AI 生成作品显著标注;在世作家风格仅内部评测(见 FR-3);对外风格对象限于已故作家;内容双闸过滤
可扩展风格配置与模型权重解耦,新增风格无需改前端

08埋点与数据分析

8.0 事件定义规范 v0.2 新增

所有事件统一走 POST /v1/track,格式 {event, ts, session_id, request_id, props};核心事件如下:

事件名触发时机关键属性
generate_start用户发起一次生成style, target_len, mode(单次/分章)
generate_success生成正常结束chars, tokens, latency, rounds
generate_error生成失败 / 异常error_type(截断/超时/循环/重复/违规), err_detail
edit_action用户二次编辑action(续写/改写/插入/删除), chars
export_action作品导出 / 分享format(md/pdf/latex), shared(bool)
feedback_submit作品级点赞 / 点踩 / 评语sentiment, dimension

8.1 生成链路指标

指标定义目标
生成长度分布输出 token / 字数直方图长文本占比 ≥ 30%
生成时长首 token 延迟、总耗时、TPS流式可见
截断率 / 超时率generate_error(截断/超时) / 总请求< 1% / < 0.5%
循环思考 / 重复生成率自动检测命中数 / 总请求< 0.5%

8.2 用户行为指标

指标定义用途
提示词特征输入长度、风格对象、母题类型分布指导语料与风格优先级
续写 / 改写 / 重试率edit_action 占比判断生成质量的真实主观反馈
放弃率生成完成前离开的会话占比识别体验瓶颈
创作笔记开关使用率FR-2 笔记开启 / 关闭占比、停留时长验证 FR-2 产品价值

8.3 质量评估指标

指标定义数据源
点赞 / 点踩作品级轻量反馈feedback_submit
专家评分专家团按四维(意象 / 结构 / 语言 / 情感)打分盲测面板
图灵测试结果二选一盲测正确率与置信度盲测任务(AC-1)
风格指纹偏差同风格多次生成的 64 维特征距离离线评测(AC-5)

8.4 数据闭环

所有埋点数据汇入分析看板,定期产出 质量报告 + 异常报告,反哺语料清洗、风格锚定与模型迭代;专家评分与用户反馈进入偏好数据集用于下一轮微调(如 KTO / RLHF)。

8.5 隐私与合规 v0.2 新增

09上线计划与商业模式

9.1 开源范围界定 v0.2 新增

渠道发布内容范围
Hugging Face模型权重(基座 + 风格微调权重)、Tokenizer、评测基准(Benchmark)、Hard 难样本数据集开源
GitHub训练 / 推理 / 数据处理脚本、评测代码(诗性评测体系、风格指纹)、文档、示例作品集开源
独立商业化产品源码(产品层)网页端、服务端、多 Agent 编排实现不开源(闭源商业产品)

许可建议(待法务确认):模型权重 Apache-2.0(含私有风格数据时改为 CC-BY-NC-4.0);代码 MIT;数据集 CC-BY-4.0。

9.2 里程碑(建议排期,自评审通过日起算)v0.2 新增

M1 · 阶段一(T+0 ~ 2 月)
长文本 / 超长文本生成链路 + 异常记录 + 埋点 + 盲测面板 + FR-4 基础功能;内测
M2 · 阶段二(T+2 ~ 4 月)
风格分期锚定 + 风格指纹评测达标(AC-5);首期已故作家风格上线
M3 · 图灵检测(T+4 ~ 5 月)
专家团双盲测试,达成 AC-1 / AC-2 验收标准
M4 · 开源发布(T+5 ~ 6 月)
HF 权重 + GitHub 代码 + 技术报告 + 示例作品集 + GOAI 大赛作品提交

9.3 商业模式 v0.2 新增

收入来源说明
产品订阅独立商业化写作产品等产品层按订阅制收费(免费额度 + 专业版),承接近期创作类用户
API 授权风格化生成 / 长文成书能力以 API 形式对 B 端(网文平台、出版社、内容团队)授权
开源杠杆开源权重与评测基准作为品牌与人才磁石,反哺产品获客与社区生态

10依赖与风险

10.1 关键依赖与成本预算

依赖说明成本量级
算法能力长上下文注意力、风格控制、长文一致性解码自研为主
算力硬件3B 风格模型微调:RTX 4060 8GB 已验证可跑(QLoRA);27B 训练 / 长文推理需租用 GPU本地 0 额外成本;27B 阶段预算按需预留(评估预留项)
语料数据风格语料(正典文本 + 已故作家全量作品)、学术研究语料(知网)、专家标注数据采集与清洗人力
专家团9–12 名文学专业评审持续参与(见 4.2)评审稿酬 / 权益

10.2 风险与对策 v0.2 扩充

风险等级对策
图灵检测失败 / 专家团不认可(v0.2 新增)兜底:KPI 切换为专家四维评分与用户留存,定位调整为"人机协作创作工具";图灵作为研究目标而非唯一门槛,不因未达标而放弃上线
风格学习"只学表面"(意象拼接)学术语料辅助理解内核 + 风格指纹评测 + 专家盲测把关
长文本 / 超长文本连贯性不足分阶段实现(先长度后风格)、大纲 / 分章结构化生成、续写回环验证
在世作家版权与人格权(v0.2 新增)在世作家仅内部评测、不对外服务不发布;对外限已故作家(版权公有 / 已授权);AI 生成显著标注(对应 FR-3 / NFR-1 合规)
算力不足导致迭代缓慢小基座起步(已验证 3B 路线)、量化推理、开源协作分摊成本
合规风险(内容安全)生成前后双闸过滤,违规样例进入异常库持续迭代

11附录 A · 反馈要点摘录(已脱敏)

与 3.2 互为印证:3.2 为结构化分析,此处收录原始表述;已去除全部用户名与身份信息。

专家团评审(风格仿写实验)

"作家风格存在明显创作分期(先锋期 / 温情期 / 现实期),须先明确锚定模仿哪一阶段。先锋期语言冷硬、剥离抒情;温情期朴素线性、隐忍克制。"
"核心意象没有贯穿始终,更像一个标签;文风混杂,先锋冷感与温情叙事交替,调性割裂。叙事可更克制,少直接交代心理,多用动作场景暗示情绪。"
"时代性细节有误:部分器物不符合语境(如黄酒品类、每日两碗白米饭过于奢侈)。环境描写铺排多但不详细,真实感降低、喧宾夺主。"
"方向可以优化:把已写过的题目以另一种风格重写,可扩充人类文学;当模型有稳定风格与泛化能力后,可实现文学工业化。"

社区反馈(诗歌生成实验)

"除了词汇没有看到相像之处,句式过于白话、修辞极度简单,意象化、跳跃和含混的特征十分不足。"
"拼接高频词,句式、结构、气质与作家本人无关。诗的困境:平均化、能知道它想写什么;思维链式考究是诗歌的反面,人的诗是直接性的。"
"语言和风格的模仿会随模型扩张而变得像人,但做到引人共情才是关键;很难挑出一两句让人眼前一亮的句子。"
"建议挖掘已故文人,风格相对固定,且'学其风格写新题'的文学可见性更强。"