来自该信源的全部动态 · 共 677 条
论文提出面向并购套利的语言模型预测系统,用于判断已宣布并购交易能否完成。研究重点从短新闻片段扩展到数百页监管、交易和财务文件的长上下文推理,探索LLM在高风险金融预测中的适用性。
论文研究台湾场景下端侧英译繁实时字幕翻译,聚焦短输入输出、批量为一、低延迟与隐私约束。作者从LMT-60-0.6B出发做性能剖析,指出在GGUF量化后,词表投影等解码环节可能成为更关键瓶颈,强调按实际负载设计优化。
论文提出开源 Python 包 FindMyText,用于判断给定文本是否部分或完整出现在大规模网页抓取语料中。方法基于文档指纹,并新增匹配指纹序列链检测,以更可靠识别近逐字复制,适用于训练数据溯源、版权审计和数据污染分析。
论文提出CLIR-Bench,面向稀疏、不规则采样、异步的临床时间序列多模态问答,评估模型能否定位并利用真实时间证据。该基准弥补常规时序QA和静态医学QA不足,适合检验临床决策支持场景中的时间推理能力。
论文从重构视角研究信息局部性对语言模型学习的影响:在句法相关词被人为拉远的「不可能语言」输入下,考察模型能否恢复自然语言结构,并借此分析其归纳偏置与语言可学习性。
论文研究在提示词中加入标注者人口属性,如何影响LLM预测与人类标注的一致性。作者用5个开源模型、5类任务,遍历单属性到全属性组合,发现更多属性并不总是提升对齐,反而可能降低一致性,且效果受属性构成、任务和模型共同影响。
论文提出EYT-Bench,用于评估LLM多轮对话能力,覆盖人设一致性、意图跟踪、情绪变化与目标完成。其三方解耦设计包含基于人设的用户模拟器、拆分意图感知与回复生成的目标模型,以及独立评判器。
论文研究极低资源语言Warlpiri的跨语言ASR迁移,提出结合预训练语音模型的声学相似度与类型学、音素、语法等语言相似度的框架,用于选择更合适的源语言,提升少量转写数据下的语音识别效果。
论文针对长文摘要常超出LLM上下文限制的问题,提出专家-编辑式阶梯提问多智能体框架:由专家逐步生成问题并抽取要点,编辑整合与修订摘要,以提升覆盖度、连贯性和长文处理效果。
论文研究在无法访问原始训练数据的情况下,将开源口语语言模型适配到新加坡Home Team场景,覆盖四种官方语言的五类语音任务。方法结合LoRA微调与替代文本问答数据,关注多语种口语查询和敏感领域部署。
论文面向POLAR Shared Task 2026,研究英语与豪萨语在线两极化话语的检测和表征。作者采用混合建模:高资源英语侧重DeBERTa等单语强模型,低资源豪萨语利用AfroXLMR-Social跨语能力,关注多语言场景下的鲁棒检测。
论文提出 IsalHG,将任意有限连通、超边元数有界的超图编码为紧凑指令字母表上的字符串,并由包含稀疏超图、循环双向链表和遍历指针的小型虚拟机执行,为超图结构序列化与形式语言建模提供方法。
论文提出 PolyInterview,一个基于大语言模型的沉浸式模拟面试平台,面向求职练习中真实互动不足、专家辅导昂贵和反馈缺乏证据等问题。系统通过自适应对话、多通道交互和多模态评估,为候选人提供结构化反馈与能力诊断。
论文提出开源平台CAFE,将实验设计中的因子设计引入复合AI系统评估。开发者可把检索器、模型、提示词等可替换组件注册为因子,系统化测试组合并量化各因素及交互对答案质量的影响,帮助定位性能瓶颈与优化优先级。
论文提出PTEI框架,将人格特质引入大语言模型的情绪智能任务,以弥补模型在复杂情绪推理中与人类的差距。作者认为个体差异是人类情绪推断的重要基础,纳入人格信息可提升LLM对情绪场景的理解与推理能力。
论文研究语言模型如何区分现实、绘画、信念、记忆、假设等不同「心理空间」中的实体属性差异。作者从形式语义与心理空间理论出发,探查模型是否用统一机制处理这些语境,提出共享路由器与值槽的解释框架。
论文提出RouteRec框架,将推荐系统中协同过滤、序列模型、内容检索与LLM重排器等异构代理的取舍,建模为受成本约束的任务感知排序问题,并比较请求级硬选择与项目级学习聚合,为多代理推荐系统评估提供更严格基准。
论文研究后训练量化对大模型推理过程的影响。作者用六类失败分类法分析5个3B至14B指令模型在FP32、FP16、NF4和4个推理基准上的3万条思维链,发现即使准确率保持,推理错误类型与过程也会发生隐性迁移。
论文关注大语言模型事实性错误与知识编造问题,提出以「Diversion Decoding」评估模型不确定性并检测幻觉。方法试图在生成过程中捕捉偏离信号,为提升LLM可靠性、事实核查和问答系统可信度提供新思路。
论文研究推理语言模型在非英语场景下的性能与成本,以日语为案例分析。作者关注模型若按用户语言生成推理轨迹,是否会因训练数据稀缺而牺牲推理能力,并讨论其对可解释性、安全监控和多语言模型开发的影响。