1、从对话到洞察:AgenticNL2SQL驱动的智能数据分析引擎黄俊阿里云-人工智能平台PAIOutlineNL2SQL:模型精调训练构建NL2SQL Agent:智能化新范式基于NL2SQL的数据洞察Agentic RL端到端后训练OutlineNL2SQL:模型精调训练构建NL2SQL Agent:智能化新范式基于NL2SQL的数据洞察Agentic RL端到端后训练背景和挑战后训练:有监督微调、强化学习Agent:任务规划,上下文工程、工具调用基础大模型落地到业务的过程场景化解决方案模型服务(MaaS)灵骏智算服务&机器学习框架(PaaS)计算资源&基础设施(IaaS)AI应用:自动驾驶/
2、科研智算/金融风控/智能推荐/智能设计/智慧城市/智能制造/智慧医疗/智慧法务/第三方MaaS平台ModelScope 魔搭社区ModelStudio 阿里云百炼 PAI-Model Gallery/PAI-Notebook Gallery/PAI-LangStudio 标注服务(ITAG)交互式建模(DSW)分布式训练(DLC)开发者工具:数据处理:Datajuicer 模型蒸馏:EasyDistill 大规模训练:PAI-Megatron-patch 强化学习:PAI-RL 优化与加速:数据集加速/训练加速/推理加速/自动容错训练AI安全(RAI)PAI-灵骏计算资源云原生通用计算资源大数
3、据计算资源(MaxCompute/EMR/Flink)模型在线服务(EAS)数据处理(DataJuicer)阿里云人工智能平台PAI云原生的一站式AI开发平台NL2SQL:智能数据分析场景的关键因素1.自然语言的多样性:查询表达方式的多样性丰富的领域行业术语2.数据库结构适配:复杂的Schema处理动态schema变化3.SQL生成准确性与鲁棒性语法正确逻辑正确长尾查询覆盖4.其他:数据安全、查询性能等NL2SQL复杂性:数据处理开源基准数据SQL引擎产品文档业务相关数据数据校验数据合成数据处理数据采集原始数据(十万条量级)处理流程NL2SQL训练数据(百万高质量数据)数据采集开源基准数据数据
4、集名称特点支持引擎Spider跨领域复杂SQL(200+数据库,10k+问答对),含多表连接和嵌套查询SQLiteWikiSQL基于维基表格的简单SQL(80k+样本),适合单表查询入门多引擎CHASE中文多轮对话式Text-to-SQL(5k+轮次),适合中文场景多引擎Bird含数据库内容推理的复杂查询(12k+样本),需理解数据分布MySQL/PostgreSQLCSpiderSpider的中文翻译版,保持原版复杂SQL特性SQLiteDuSQL百度发布(23,797问),含业务逻辑查询(如“环比计算”)和歧义澄清需求MySQLSParCSpider的多轮对话扩展(4,298组对话,12k
5、+轮次),需上下文依赖的SQL生成SQLiteTableQA基于维基/网页表格的QA对(14k+样本),支持跨表推导(如“合并两个表格的相同列”)Spark SQL,BigQuery数据采集引擎产品文档:用于大模型学习引擎相关知识数据采集业务相关数据:用于大模型学习业务相关知识业务常用表元数据业务知识文档历史SQL1.将数据处理成模型友好的格式,方便后续进行训练数据处理元数据组织形式prompt的组织形式 示例:以MaxCompute“INSERT INTO|OVERWRITE”帮助文档为例:首先使用换行符对文档进行片段切分 然后按照不超过2048token为原则形成分块(当添加一个片段导致当
6、前分块超过2048token时,该片段属于下一个分块)数据处理2.将文档进行格式标准化、分块、压缩、抽取等操作,获取语义完整和正确的文本片段,支持后续数据合成 将表元数据和历史SQL进行配对 将表元数据和表相关业务文档进行配对 总结业务相关的问题分类 3.数据配对:支持后续数据合成数据处理数据合成1.SQL引擎相关数据合成:通过构造的NL2SQL数据学习SQL引擎相关的基础语法知识2.业务相关数据合成:根据给定的SQL和表元数据,调用大模型反向生成用户可能的问题,形成问题和SQL配对数据合成对业务取数问题进行归类,然后通过定制化prompt的形式调用大模型进行NL2SQL数据合成描述性分析(统