摘要:采购原材料并取得增值税专用发票
评分提示:复盘中需要补充进项税额抵扣条件与付款凭证对应关系。
评分详情 · 本地运行截图
展示 AI 评分、维度判断与票据摘要的真实界面。
金额
税额
供应商
2026 人工智能赋能教育创新应用大赛 · 参赛作品
大模型赋能财务实训
以校企合作研发的 Nexora IPA 智能记账系统为原型,构建面向会计实训的教学平台。 针对通用大模型在垂直领域成本高、精度不足的问题,基于 Qwen3-8B 开源模型, 通过 QLoRA+SFT 轻量化领域优化与课程评分量规, 形成"模型生成—规则校验—评分解释"的教学闭环,让 AI 大模型真正落地会计课堂。
从企业级 IPA 原型到课堂教学平台
为顺应国家教育数字化战略与人工智能赋能教育教学的总体方向,我们团队依托学院与企业合作研发的 Nexora IPA(智能流程自动化)记账系统为原型,将企业级的财务 AI 能力迁移至教学场景, 设计了面向高职会计实训的大模型教学平台。
我们的目标不是展示"AI 有多强",而是让学生在真实的会计任务中理解 AI 能做什么、不能做什么、如何审慎地使用它,培养适应智能财务时代的复合型技能人才。
采购原材料并取得增值税专用发票。
- 借
- 1403 原材料 28,600.00
- 借
- 2221.01 进项税额 3,718.00
- 贷
- 1002 银行存款 32,318.00
我认为还要核对发票抬头、税号和供应商信息,确认进项税额能否抵扣。
优先处理低分与异常复盘,把教师注意力集中到教学薄弱点。
provider: qwen3-8b
adapter: qlora
rubric: accounting_training
fallback: deepseek
维护模型供应商、评分规则与知识库来源,让课堂流程和模型优化保持同一套证据链。
从通用模型局限到会计实训闭环
在教学场景中逐步推广 AI 应用后,我们发现一个核心矛盾:大参数模型语义理解强、生成质量高, 但单次推理成本高;小参数模型部署成本低、响应快,却容易在会计垂直知识上出现分录不规范、准确率偏低。
因此,本项目把「模型适配、课程量规、证据检索、评分解释」组织成可复核链路, 让优化结果能够被教师理解,也能够被评审快速检视。
Research Report
教学场景中会计 AI 应用的核心矛盾
执行摘要
在会计实训课堂中引入 AI 后,真正的矛盾并不是简单的“大模型贵、小模型差”, 而是模型能力、推理成本、会计规范和教学目标同时作用后的系统性冲突。 大模型在中文语义理解、跨句推断、复杂指令遵循和长上下文整合上更稳, 但其推理成本、显存占用、首 token 延迟和课堂并发压力更高; 小模型更容易本地部署、响应更快,却更容易在会计科目选择、借贷方向、 税额处理、字段完整性和依据引用上出现偏差。 对本项目而言,问题不在于找到一个“万能模型”,而在于把模型能力放进可约束、可复核、可教学的工作流中。
会计任务不是普通问答
会计实训并不是开放式文本生成,而是围绕“票据识别—业务判断—分录生成—评分反馈—学生复盘”的连续任务。 模型不仅要理解一段业务描述,还要抽取票据字段、识别经济业务实质、判断会计科目、 处理价税关系、保持借贷平衡,并把结论解释为教师和学生都能复核的依据链。 在这个场景里,“说得像会计答案”远远不够;如果答案无法回到票据、课程规则、科目表和评分量规, 它就不能直接成为教学依据。
因此,会计 AI 的失败形式往往很隐蔽:科目看似合理但粒度错误,借贷方向大体正确但税额处理不稳, 摘要与分录不完全一致,解释写得流畅却没有被原始凭证或课程规则支撑。 这些错误在普通聊天中可能只是回答质量问题,但在教学场景中会转化为误导学生的学习风险。 学生一旦把“模型给出的流畅解释”误认为“规范做账依据”,教师后续讲评就会面对更难纠正的认知偏差。
规模效应与课堂成本的对冲
大模型能力更强,背后是参数规模、训练数据和后训练流程共同带来的规模效应。 但课堂部署关心的不是单次演示效果,而是一个班级、多个班级、多个教学周中持续可用的成本和响应体验。 推理阶段的成本受模型权重、前缀预填充、KV Cache、上下文长度、带宽和自回归解码影响。 当学生集中上传票据、教师集中批阅作业时,长上下文和并发会把一次看似可接受的模型调用放大为课堂级成本压力。 这也是为什么“直接上更大模型”不能成为唯一方案。
小模型失真来自数据与约束不足
小模型的问题也不应被粗暴理解为“参数少所以一定不行”。 如果训练数据充分、目标函数正确,并且外部规则约束足够强,小模型可以承担大量低风险、高频率的课堂任务。 但在真实会计教学中,高质量标注样本稀缺,长尾业务案例覆盖不足,课程量规和会计规则又常常没有被结构化写入系统。 于是小模型容易学到会计语言风格,却没有稳定掌握“凭证字段齐全、科目合法、借贷平衡、依据可追溯”的底线能力。 这类问题不能只靠提示词修补,必须通过结构化输出、规则校验和评测集来治理。
教学设计中的核心风险
课堂实训关注的不只是学生是否写出了分录,更看重其是否能够说明业务事实、辨认会计科目、 复盘错误来源,并在教师讲评后修正理解。若系统只输出最终答案或单一得分, 学生可能把注意力放在“怎么让模型给我结果”,而不是“为什么这样记、为什么这样改”。 AI 若不能把分录、解释、评分、复盘和教师复核连接起来,反而会削弱课堂诊断功能。
对本项目的边界含义
因此,本项目不应把会计 AI 定位为“自动做账终局系统”,而应定位为“可复核的草稿引擎、证据整理器和反馈助手”。 学生端先上传真实票据,再查看 AI 分录草稿、完成业务复盘、接收评分反馈; 教师端则查看 AI 评分、复核学生复盘、进行讲评并回收教学薄弱点。 这一路径的关键,是把模型输出还原为可检查的教学证据链: 票据是否支撑分录,规则是否支撑校验,量规是否支撑评分,解释是否能被教师复核。
Optimization Path
面向课堂实训的轻量化优化路径
执行摘要
面向课堂真实任务,优化路径不宜走“更大模型、更多参数、完全自动化”的单一路线, 而应走“结构化输出 + 外部知识 + 会计规则 + 轻量适配 + 分层路由”的组合路线。 这条路径的目标不是让模型替代教师,也不是让学生跳过思考过程, 而是在有限成本下把模型从通用回答器收敛为课堂实训助手: 能生成草稿、能引用依据、能暴露不确定性、能被规则校验、能让教师复核。
第一步:把规范性做成硬约束
会计分录和凭证草稿不应由自由文本直接承接。系统应先规定稳定的输出 schema, 把日期、摘要、会计科目、借贷方向、金额、原始凭证数量、证据引用、置信度和是否需要复核写成明确字段。 生成后再用规则引擎检查科目白名单、借贷平衡、金额合法性、税额一致性、字段完整性和依据缺失。 这样即使模型语义理解出现波动,系统也能在进入教学环节前把明显不合规的结果拦截下来。
- 01结构化输出把分录、依据、置信度和复核状态固定为可校验字段。
- 02规则校验用科目白名单、借贷平衡、税额一致性约束模型草稿。
- 03知识检索把教材、准则、量规、题库和错题案例外置到课程知识库。
- 04分层路由低风险任务用轻量模型,高风险任务升级到强模型或教师复核。
第二步:把知识从参数中拉回系统
会计知识更新频率不一定最高,但其规范性和可追溯性要求很高。 因此,准则条文、教材章节、课程题库、标准答案、评分量规、科目表和典型错题不宜全部压进模型参数。 更稳妥的做法是建立分层知识库:稳定层放会计准则和制度口径,半稳定层放教材、课程规范和评分 rubric, 易变层放本学期案例、教师补充材料和学生常错点。 模型负责读取、组织和解释,系统负责提供依据、记录命中来源和支持教师追溯。
第三步:用轻量适配提升领域习惯
在模型层,项目可以采用可控基座模型作为高能力内核,再用 QLoRA、LoRA 或 SFT 学习会计课堂的输出习惯。 适配的重点不应只是让模型“更像会计老师说话”,而是让它稳定遵守票据描述方式、分录格式、 复盘表达结构、评分解释口径和拒答/升级条件。 这些样本必须来自经过规则校验和教师抽检的真实教学数据,否则微调只会把偶发错误放大为系统习惯。
第四步:用分层路由控制成本
课堂系统里并不是每一次请求都需要最强模型。低风险、高频率、强模板化任务可以由轻量模型或缓存承担, 例如字段抽取、格式整理、标准题复盘提示和已审计答案复用。 当任务涉及复杂业务判断、多凭证关联、低置信度、规则校验失败或学生答案与依据冲突时, 系统再升级到更强模型或教师复核。这样的混合架构可以把大模型能力用于真正高价值的环节, 同时降低平均成本和课堂等待时间。
第五步:建立可复现评测闭环
优化不能只看一个“准确率”。会计实训需要把效果拆成可复现指标: 分录正确率、科目合法率、借贷平衡率、税务处理正确率、格式合规率、依据匹配率、教师复核通过率、 首 token 时间、完整响应时间、单次请求成本和审计回放完整度。 这些指标要进入版本评测、课程回归和教学运营看板,让每一次模型更新、知识库更新或规则调整都能被比较。
最终形态:可治理的教学工作流
最终,本项目应呈现为一个受约束的会计教学工作流,而不是一个普通聊天机器人。 学生上传真实票据,系统生成可校验草稿;学生围绕草稿完成复盘,系统给出分项评分和依据; 教师复核评分、讲评薄弱点,并把高质量样本回流到知识库、规则库和领域数据集中。 这条链路让大模型保留复杂语义理解能力,让小模型承担可控高频任务, 让规则和证据承担可追溯约束,最终形成“模型生成—规则校验—评分解释—教师复核—课堂反馈”的闭环。
Technical References
公开方法如何用于本项目
下列公开方法用于说明本项目中每类技术选择对应的来源:DeepSeek-R1 用于理解推理与蒸馏路线, LoRA/QLoRA 对应低成本适配,RAG 对应课程规则与知识库检索,DPO 和 Self-Instruct 对应后续偏好优化与样本扩展。
Model Report
会计实训模型表现
优化前 88.79% → 优化后 92.32%
优化前 74.6% → 优化后 89.3%
优化前 0.923 → 优化后 0.894,业务指标更贴近课堂评分目标。
优化前 ¥0.12 → 优化后 ≈¥0.02
从课堂实训到教师评阅到持续优化
教师可以在课堂中直接使用本系统完成"发布作业→学生实训→AI 评分→教师复核→课堂讲评"的完整教学链条。 大模型优化不是脱离教学的"黑盒",而是融入每个教学环节的辅助工具。
学生上传票据、查看 AI 分录草稿、完成业务复盘、查看评分反馈,形成"做中学"的完整实训体验。