📰 每日 AI 资讯

2026年08月19日

最后更新:2026-08-19 08:03:15 UTC+8

🔹 Hacker News

macOS 桌面上的 3D 果蝇由真正的 FlyWire 连接组提供支持

文章网址:https://github.com/DenisSergeevitch/desktop-fly 评论网址:https://news.ycombinator.com/item?id=49353221 积分:74 # 评论: 18

📅 ue, 18 Aug 2026 🔗 原文链接

fx :小型、开放、本机编码代理。

文章网址:https://fx.sh 评论网址:https://news.ycombinator.com/item?id=49353339 积分:53 # 评论:29

📅 ue, 18 Aug 2026 🔗 原文链接

GLM-5.3 人工分析基准

文章网址:https://artificialanalysis.ai/models/glm-5-3 评论网址:https://news.ycombinator.com/item?id=49353407 积分:56 # 评论: 18

📅 ue, 18 Aug 2026 🔗 原文链接

软件团队中的人工智能使用模式

文章网址:https://linear.app/data 评论网址:https://news.ycombinator.com/item?id=49353432 积分:12 # 评论: 1

📅 ue, 18 Aug 2026 🔗 原文链接

基于可编程属性的测试

文章网址:https://dl.acm.org/doi/10.1145/3828685 评论网址:https://news.ycombinator.com/item?id=49353618 积分:7 # 评论: 0

📅 ue, 18 Aug 2026 🔗 原文链接

🔹 arXiv 人工智能

全球人工智能高风险用例中的公平和道德法规:比较审查

arXiv:2608.14562v1 公告类型:新 摘要:人工智能治理正在从自愿道德转向可执行的、基于风险的监管,但跨司法管辖区的分歧给高风险人工智能运营商带来了合规不确定性。我们提出了欧盟、美国和中国的比较矩阵,其中映射了(i)风险分类触发因素,(ii)有约束力的义务,(iii)执法和问责......

📅 ue, 18 Aug 2026 🔗 原文链接

何时进行沟通:多智能体强化学习中原则性门控的置信分布和 KL 散度

arXiv:2608.14559v1 公告类型:新 摘要:多智能体强化学习中的有效通信要求智能体不仅要决定\textit{什么}进行通信,还要决定何时进行通信?现有的方法要么在每个时间步进行通信,要么通过强化策略梯度学习二元门\cite{singh2019},这是一种高方差信号,会产生不稳定且无法解释的门控行为......

📅 ue, 18 Aug 2026 🔗 原文链接

不成文的基准:抽象感知推理中多模态机器学习的新挑战

arXiv:2608.14558v1 公告类型:新 摘要:当前的多模态模型在识别静态视觉和听觉内容方面表现出了卓越的能力。然而,它们的抽象感知推理能力,即从动态生成过程中推断出看不见的信息的能力,仍然是一个关键且尚未充分探索的前沿领域。在本文中,我们介绍了不成文的基准,一个新的...

📅 ue, 18 Aug 2026 🔗 原文链接

大型语言模型显示医学推理中的元认知敏感性

arXiv:2608.14552v1 公告类型:新 摘要:大语言模型 (LLM) 在医学中得到越来越多的评估和使用,但临床实用性取决于答案的准确性以及置信度是否跟踪证据质量和不确定性。我们开发了一个受控的、受心理物理学启发的临床基准来测试医学法学硕士的诊断选择和信心行为。该基准重点关注...

📅 ue, 18 Aug 2026 🔗 原文链接

失败与实际工作:人工智能效率评估中复制的重要性

arXiv:2608.14550v1 公告类型:新 摘要:由于模型规模庞大、能源需求高和环境成本高,人工智能效率最近受到学术界和工业界的关注。虽然报告浮点运算 (FLOP) 是评估计算成本的传统方法,但 FLOP 和执行时间之间的关系并不简单,因为具有...的层

📅 ue, 18 Aug 2026 🔗 原文链接

🔹 Reddit 机器学习

训练了一个在 264KB RAM 上运行的扩散模型 [P]

我最近买了一台 Shrike lite,它有 264KB 的 SRAM。我决定训练一个生成 32*32 像素图像的图像生成模型。该微控制器还具有板载 FPGA,我用它来创建两个具有 16 位累加的并行 INT8 MAC 引擎以加速计算,但是由于大量 I/O 操作,系统很快就遇到了内存墙,这意味着系统...

📅 2026-08-18 09:26 🔗 原文链接

我们有一个关于使用开放模型进行生产检索增强生成的研讨会,进行端到端基准测试,认为它在这里相关[D]

8 月 29 日将举办一个实践研讨会,使用完全开放的模型,不涉及 API 调用,端到端地正确构建和基准测试。由人工智能顾问兼 Chelsea AI Ventures 创始人 Ben Auffarth 领导。它涵盖的内容: • 混合检索(向量 + 关键字,而不是单独的向量) • 重新排名以捕获单独的向量搜索遗漏的相关块 • 使用 RAGAS 进行评估,因此质量会发生变化...

📅 2026-08-17 22:02 🔗 原文链接

如何让稀疏注意力/KV 压缩看起来不错? [D] [R]

原创文章 - https://x.com/p_nawrot/status/2089315591010079034 过去几年我一直致力于高效注意力和 KV 缓存压缩。我读过很多论文,深入研究了方法的参考或官方实现,并检查了附录——我想我学到了一些东西。其中之一肯定是“如何让事情看起来不错,即使事实并非如此”。我很内疚...

📅 2026-08-17 12:18 🔗 原文链接

[R] SineKAN:使用正弦激活函数的 Kolmogorov-Arnold 网络

我无法入睡,因为我不停地想知道是否有人尝试过使用正弦曲线而不是 B 样条曲线作为 KAN 中的激活,幸运的是/不幸的是,情况已经如此。我在这里找不到它,所以我想分享一下,希望能进行一些有见地的讨论。 Arxiv:https://arxiv.org/abs/2407.04149 Github 存储库:https://github.com/ereinha/SineKAN 另外,似乎...

📅 2026-08-17 00:46 🔗 原文链接

🔹 51AllAI

Codex GPT-5.6 Sol 配置百万代币资源

GPT-5.6 Sol 的模型上下文窗口为 105 万 Token。Codex 用户可以把会话预算设为 100 万 Token,并在约 90 万 Token 时自动压缩历史。配置既能写入 config.toml 作为默认值,也能通过 CLI 参数只作用于一次新会话。参数只声明客户端预算,最终有效上限仍由客户端与服务端共同决定。在 config.toml 中设置默认值打开 ~/.codex/config.toml,在第一个 [section] 标题之前添加或更新以下三个顶级设置:123model = "gpt-5.6-sol"model_context_window = 1000000model...

📅 2026-08-17 11:45 🔗 原文链接

Cloudflare推出AEO Visibility,开放AI引用数据早期体验

Cloudflare 推出 AEO Visibility Dashboard,当前以早期体验形式开放申请。它统计 Claude 与 GPT 回答中的引用率、提及率、突出性和声音份额,并结合真实爬取及引荐流量,帮助站长判断网站是否进入 AI 助手的推荐结果。已发布,当前开放早期体验申请Cloudflare 于 2026 年 8 月 6 日发布 AEO Visibility Dashboard。AEO 是 Answer Engine Optimization 的缩写,中文可理解为“答案引擎优化”:关注网站是否会被 AI 助手引用、提及或推荐,而不是网页在传统搜索结果中的排名。这项工具已经进入 Cl...

📅 2026-08-14 10:26 🔗 原文链接

社区推出DeepSeek Harness桌面端,支持Apple Silicon Mac与Windows

DeepSeek Harness 社区桌面端 v0.1.0 已提供 macOS 和 Windows 安装包。它将官方开源框架、本地 Web UI 与服务启停管理封装进 Electron 应用,使用者不再需要先安装 Node.js 或输入启动命令。首个公开版本支持 Apple Silicon Mac 与 Windows x64。这是社区项目,不是 DeepSeek 官方桌面客户端。下载安装包就能启动 HarnessDeepSeek Harness 官方版已经以 MIT 许可证开源,当前定位是开发者预览版。它是一套智能体执行框架:模型负责理解任务和生成下一步动作,Harness 则把这些动作连接到...

📅 2026-08-14 07:44 🔗 原文链接

智谱发布GLM-5.3,已上线Coding Plan与ZCode

智谱于 2026 年 8 月 14 日发布 GLM-5.3。模型已全量进入 GLM Coding Plan,并可在官方编程工具 ZCode 中使用。GLM-5.3 支持 1M Token 上下文和 128K Token 最大输出,定位于代码库级别的长程编程与多步工具调用任务。GLM-5.3 已进入 Coding Plan 与 ZCodeGLM-5.3 已向 GLM Coding Plan 全量用户开放。Coding Plan 是智谱面向编程工具的订阅式入口,用户可以把套餐账号连接到支持的编程智能体,让模型读取项目、修改文件、运行命令并根据结果继续调整。ZCode 是智谱的桌面端智能体开发环境,...

📅 2026-08-14 05:52 🔗 原文链接

MiniMax 开放 Music 3.0 权重,最长生成 5 分钟完整歌曲

MiniMax 开放 Music 3.0 模型权重。模型接收歌词与音乐描述,可一次生成最长 5 分钟的完整歌曲,输出 32kHz、16 位立体声 WAV。开发者可通过 SGLang-Omni、Diffusers 或 ComfyUI 在 CUDA 显卡上本地运行。开放的是模型权重与配套文件Music 3.0 的权重仓库已经公开,无需提交访问申请。仓库包含模型权重、配置、分词器、示例脚本、参考音频和文档,开发者可以直接下载到本地。代码仓库还提供音乐描述改写 Skill,可把简短想法整理成结构化的曲风、演唱和编曲说明。相关仓库与文件入口:GitHub:MiniMax-AI/MiniMax-Music...

📅 2026-08-14 05:41 🔗 原文链接

ChatGPT 和 Codex 加入计算机历史,按授权调用 Mac 活动记录

Computer History 已加入 ChatGPT macOS 应用,可让 ChatGPT 与 Codex 在用户授权后引用应用和网站活动,继续处理尚未完成的工作。功能默认关闭,不截屏、不录音,现面向 Pro、Business 和 Enterprise 用户开放。用户还可暂停记录、筛选应用与网站,并检查或删除时间线项目。Computer History 引用的是用户选定活动Computer History 是 ChatGPT macOS 应用里的可选功能。用户开启后,ChatGPT 与 Codex 可以引用来自应用和网站的指定活动,用来补足当前任务的上下文。例如,一项工作跨越多个应用时,...

📅 2026-08-14 04:08 🔗 原文链接

小红书开放 dots3-note preview 权重,支持 512K 上下文与多模态输入

小红书 dots studio 已开放 dots3-note preview 模型权重与建模代码,采用 Apache 2.0 许可证。模型总参数为 2800 亿,单次推理激活 160 亿参数,支持最长 512K Token 上下文,可接收文本、图片、视频和音频并输出文本。本文重点说明公开范围、模型结构、输入输出方式与本地部署门槛。开放的是 dots3 系列首个公开权重模型dots3-note preview 是 dots3 系列首个开放权重模型。公开内容包括模型权重和建模代码,许可证为 Apache 2.0。开发者可以从 Hugging Face 或 ModelScope 获取 BF16 原始...

📅 2026-08-14 03:35 🔗 原文链接

Google发布Gemini 3.7 Flash,开放稳定API与限时价格

Google 于 8 月 13 日发布 Gemini 3.7 Flash 稳定版。模型支持百万 Token 输入、64K Token 输出和多种内置工具,已开放 Gemini API、Google AI Studio、Antigravity 与 Gemini 应用;付费 API 限时价为每百万输入 Token 0.75 美元、输出 Token 3.75 美元。Gemini 3.7 Flash 已进入稳定版Gemini 3.7 Flash 不是一个只供测试的预览型号。Google 在 2026 年 8 月 13 日将它以 GA(正式可用)状态发布,开发者可以在生产应用中指定稳定模型 ID gem...

📅 2026-08-14 03:15 🔗 原文链接

DeepSeek 开放 Harness 开发者预览版,源码采用 MIT 协议

DeepSeek Harness 结束了只面向少数项目开发者的定向测试阶段,开发者预览版已可通过 npm 运行。项目源码同步公开,采用 MIT 协议,开发者可以配置模型、选择本地工作区,再通过 Web UI 让智能体读写文件和运行命令。开发者现在可以直接运行 HarnessDeepSeek Harness 不是新模型,而是让模型执行实际任务的智能体框架。模型负责理解需求和决定下一步,Harness 负责准备上下文、调用工具、记录会话和管理执行过程。对代码任务来说,它把“给出一段代码”变成一个可以读取仓库、修改文件、执行命令和检查结果的循环。开发者安装 Node.js 后,可以在项目目录运行:1...

📅 2026-08-13 13:06 🔗 原文链接

DeepSeek 公布 API 新价格,8 月 17 日起采用峰谷计费

DeepSeek 将于北京时间 2026 年 8 月 17 日 0 时启用 API 新价格。V4 Flash 与 V4 Pro 都改为峰谷计费,高峰时段为 9:00–12:00 和 14:00–18:00,其余时间的空闲价为高峰价的一半。8 月 17 日起分两个时段计费DeepSeek API 新价格将在北京时间 2026 年 8 月 17 日 0 时生效。高峰时段是 9:00–12:00 和 14:00–18:00,其余时间划为空闲时段。同一款模型、同一类 Token 在空闲时段的单价是高峰时段的一半。API 按 Token 计费。Token 是模型处理文字时使用的计量单位,一个汉字、英文单...

📅 2026-08-13 12:20 🔗 原文链接