avatar
文章
34
标签
50
分类
3

灯推的恬静小屋
搜索

灯推的恬静小屋

SACK:在不可信云上高效执行动态属性权限
发表于2026-07-23|更新于2026-08-13|论文解读|DataEngine•论文解读•SACK•ABAC•数据安全
SACK 论文解读核心结论动机架构权限更新实验项目关系 PVLDB 2026 · Dynamic ABAC · Intel SGX · Persistent KV Store SACK:在不可信云上高效执行动态属性权限 它把属性与策略放进可信 enclave,把大规模数据留在普通存储中,并用按策略密钥、KV separation 和完整性结构兼顾安全、更新效率与性能。 正式来源:PVLDB 19(6), 2026系统:SGX + RocksDB middleware安全:Confidentiality / Integrity / Freshness / ABAC原文 PDF 已保存 先说结论:把昂贵的属性加密只用来保护“小密钥”,数据本体用快速对称加密 SACK 面向不可信云上的持久化 KV 存储。它把用户属性、访问策略和密钥放进 Intel SGX enclave,数据本体仍放在普通 KV store / 磁盘上;通过按策略分组的密钥、KV separation 和完整性元数据,实现动态 ABAC、机密 ...
LatentRefusal:让 Text-to-SQL 在生成 SQL 前学会停手
发表于2026-07-23|更新于2026-08-13|论文解读|DataEngine•Text-to-SQL•论文解读•拒答•数据安全
LatentRefusal 解读核心结论拒绝什么流程TRGE实验落地 ACL 2026 Findings · Answerability Gate · Hidden States · TRGE LatentRefusal:让 Text-to-SQL 在生成 SQL 前学会停手 它不问 LLM“你确定吗”,而是直接读取模型中间层的状态:问题与 schema 对不上时,在任何 SQL 被生成之前就拒绝。 正式来源:ACL 2026 Findings基础模型:Llama-3.1-8B / Qwen-3-8B核心:TRGE latent probe原文 PDF 已保存 先说结论:在 SQL 生成之前,先判断这个问题是否真的能回答 LatentRefusal 不让 LLM 自己说“我不知道”,而是读取 LLM 中间层的隐藏状态,训练一个很小的分类器判断问题是否可回答。分数低于阈值就直接拒绝,连 SQL token 都不生成。 问题“看起来合理”的 SQL 更危险缺字段、指代不清、超出数据库范围的问 ...
Role-Conditioned Refusals:LLM 能守住智能问数的角色权限吗?
发表于2026-07-23|更新于2026-08-13|论文解读|LLM•DataEngine•论文解读•拒答•权限安全
Role-Conditioned Refusals 解读核心结论数据三种方法实验项目落地评价 EACL 2026 Findings · RBAC · Text-to-SQL · Safe Refusal Role-Conditioned Refusals:LLM 能守住智能问数的角色权限吗? 这篇论文不是在问模型会不会写 SQL,而是在问:同一个问题由不同角色提出时,模型能否该答就答、该拒绝就拒绝。 正式来源:EACL 2026 Findings数据:Spider-ACL / BIRD-ACL核心:Prompt vs Verifier vs LoRA原文 PDF 已保存 先说结论:LLM 可以参与权限判断,但不能独自当门卫 论文把同一个问数问题交给不同角色,要求模型在有权限时生成 SQL、没权限时明确拒绝。结果表明:让一个模型同时“理解问题、生成 SQL、判断权限”不够稳定;先生成候选 SQL,再单独核验 SQL 触碰了哪些表和字段,通常更可靠。 做了什么给 Spider / BIRD ...
AI-Driven Analytics Runtime 论文解读
发表于2026-07-16|更新于2026-08-13|论文解读|DataEngine•论文解读•Agent•AI Analytics•数据系统
AI Analytics Runtime 解读 核心结论 问题 Runtime Context 实验 项目落地 CIDR 2026 · Deep Research · Semantic Operators · Analytics Runtime Deep Research 要变成真正的数据分析系统,需要一个 Runtime 这篇论文的核心观点是:数据分析 Agent 不能只靠自由写 Python,也不能只靠固定 semantic operators。理想的 AI-driven analytics runtime 要同时具备 Agent 的灵活规划能力和数据库系统的优化执行能力。 论文:Russo et al. · CIDR 2026 官方标题:Deep Research is the New Analytics Sys ...
QCP-DB 论文解读:自治数据 Agent 协作查询
发表于2026-07-16|更新于2026-08-13|论文解读|DataEngine•论文解读•QCP-DB•Data Agent•多源查询
QCP-DB 解读 核心结论 问题 QCP 原型 实验 项目落地 CIDR 2026 · Data Agents · Query Collaboration Protocol QCP-DB:从“先集成数据再查询”转向“数据 Agent 协作查询” 这篇论文提出一个面向未来数据系统的架构愿景:不再要求所有数据先被搬进统一数仓和全局 schema,而是让每个数据源背后有自治 Data Agent,按协议协作完成查询。 论文:Eckmann & Binnig · CIDR 2026 官方 PDF 已本地保存 核心概念:QCP / QCP-DB 适用主题:智能问数、数仓、多源数据 Agent 核心结论 ...
ContextCache 论文解读:智能问数里的上下文感知语义缓存
发表于2026-07-09|更新于2026-07-09|论文解读|DataEngine•智能问数•论文解读•ContextCache•缓存•PVLDB 2025
ContextCache 解读 核心结论 问题 方法 实现 实验 项目落地 PVLDB 2025 · Semantic Cache · Multi-Turn LLM Queries ContextCache:智能问数缓存不能只看“当前问题”,还要看“上下文” 这篇论文研究 LLM 多轮对话里的语义缓存。它的核心提醒很适合智能问数:两个问题字面很像,不代表可以复用同一个答案;缓存命中必须同时匹配当前问题和历史对话上下文。 论文:ContextCache · PVLDB 18(12), 2025 主题:上下文感知语义缓存 核心结论 做了什么 ContextCache 做了一个多轮 LLM ...
智能问数产品现况、优缺点与项目启示
发表于2026-07-01|更新于2026-07-01|数据工程|DataEngine•数据工程•智能问数•BI•Text-to-SQL
智能问数产品现况、优缺点与项目启示更新时间:2026-06-26 1. 结论先行智能问数正在从早期的“自然语言转 SQL”进入“语义层 + 数据治理 + Agent 工作流”的阶段。2023 年前后的多数产品强调“问一句、出一张图”;2025-2026 年主流方向已经明显变成:围绕可信语义、权限、指标口径、可解释查询、多轮分析、自动报告、嵌入式数据智能体来做完整闭环。 当前市面产品大致分为四类: 传统 BI 厂商的 AI 化:Power BI Copilot、Tableau Agent、ThoughtSpot Spotter、Qlik、FineBI/FineChatBI、Quick BI 小Q、Smartbi AIChat、观远问数 Agent 等。优势是 BI 底座、权限、图表和企业交付成熟;短板是价格、绑定生态、二开受限。 云数仓/数据平台原生智能问数:Snowflake Cortex Analyst、Databricks Genie、Looker Conversational Analytics、Amazon QuickSight Q 等。优势是和底层数 ...
智能问数产品现况与选型观察
发表于2026-07-01|更新于2026-07-02|数据工程|DataEngine•数据工程•智能问数•BI•Text-to-SQL
智能问数观察 2026-06-26 · 产品现况与项目启示 现况判断 市场地图 海外产品 国内产品 开源方案 横向对比 落地难点 项目路线 智能问数产品现况与选型观察 从“AI 写 SQL”到“语义层驱动的可信数据智能体”,主流产品正在把问数、图表、权限、指标口径、洞察报告和 Agent 工作流接到一起。 ChatBI Text-to-SQL Semantic Layer Agentic BI 4 类商业 BI、云数据平台、国内厂商、开源自建 1 条主线从自然语言转 SQL 走向可信语义与治理 30-50建议 MVP 先用高频问题集验证准确率 不是模型成败核心是指标口径、权限和持续运营 一眼看清:产品正在往哪里走 智能问数已经不再只是把一句中文翻译成 SQL。越成熟的产品,越强调语义模型、指标治理、权限、安全执行、可解释回答和反馈评测。 商业 BI AI 化 从看板到对话 Power BI、Tableau、ThoughtSpot、FineBI 等把自然语言入口放进已有 BI 体系,优势是权限、报表、图表和交付成熟。 云平台原生 从数据 ...
LinkAlign 论文解读:大规模多库 Text-to-SQL 的 Schema Linking
发表于2026-06-12|更新于2026-06-12|论文解读|DataEngine•Text-to-SQL•Schema Linking•LinkAlign•论文解读•EMNLP 2025
LinkAlign 解读 核心结论 问题 方法 实验 项目落地 评价 EMNLP 2025 Main · Schema Linking · Multi-Database Text-to-SQL LinkAlign:让 LLM 在海量数据库里先找对库,再找对表字段 这篇论文不是又做一个 SQL 生成器,而是专门解决真实企业场景里的前置难题:用户一句自然语言进来,系统面对很多库、几千个字段,怎么把问题精确对齐到正确数据库、表和列。 论文:Wang, Liu, Yang · EMNLP 2025 ACL Anthology ID: 2025.emnlp-main.51 核心任务:schema linking 官方 PDF 已本地保存 核心结 ...
LinkAlign Lite 数据中台 Schema Linking 实验报告
发表于2026-06-11|更新于2026-06-11|实验|数据中台•数据治理•DataEngine•实验•Schema Linking•LinkAlign
LinkAlign Lite 数据中台 Schema Linking 实验报告生成日期:2026-06-11项目目录:D:\AGENT\data-skill-schema-minerpro实验主题:把 D:\AGENT\DataEngine\LinkAlign 论文解读中的 schema linking 思想,应用到浙江音乐学院数据中台 skill/MCP 项目中,并用全量字典任务与 doops 在线元数据验证做对比评估。 1. 实验结论这次实验已经从“只看几个例子”升级成了两层评测: 全量字典离线评测:覆盖 100 条由全量标准字典生成的任务,包含 business、table、relation、field、alias 五类问题,各 20 条。 LinkAlign Lite 在线评测:覆盖 104 条问题,其中包含上述 100 条全量字典任务,以及 4 条真实业务问题;每条都通过 doops 在线读取 Hive Metastore 元数据确认候选表字段。 总体结论: 结论 说明 LinkAlign Lite 能显著减少候选噪声 平均候选表从 7.97 张降到 ...
12…4
avatar
Akari
暂无
文章
34
标签
50
分类
3
我的BiliBili账号
公告
This is Akari's BLOG
最新文章
SACK:在不可信云上高效执行动态属性权限2026-07-23
LatentRefusal:让 Text-to-SQL 在生成 SQL 前学会停手2026-07-23
Role-Conditioned Refusals:LLM 能守住智能问数的角色权限吗?2026-07-23
AI-Driven Analytics Runtime 论文解读2026-07-16
QCP-DB 论文解读:自治数据 Agent 协作查询2026-07-16
最新评论
正在加载中...
分类
  • 实验4
  • 数据工程15
  • 论文解读7
标签
报错解决方案大模型智能体LLMCoze数据中台元数据标准字典数据治理DataEngineDeepSeek实验数据工程Skill智能问数BIText-to-SQLSchema LinkingLinkAlign数据资产L1-L5dockerQQ机器人bot部署教程论文解读AgentSQL结构化数据AIOps拒答权限安全TAG数据库提示词Prompt EngineeringAI Analytics数据系统
归档
  • 七月 20268
  • 六月 20264
  • 五月 202614
  • 八月 20251
  • 七月 20251
  • 六月 20253
  • 七月 20233
网站资讯
文章数目 :
34
已运行时间 :
本站总字数 :
102.7k
本站访客数 :
本站总访问量 :
最后更新时间 :
訪客地圖
©2023 - 2026 By Akari
框架 Hexo|主题 Butterfly
Hi, welcome to Akari's BLOG!
搜索
数据库加载中