Perplexity 介绍在 Apple silicon 上的 Lily 端侧推理引擎,借助统一内存与专用硬件在 prefill 与 decode 吞吐上超过 MLX-LM,并对 Qwen3.6-35B-A3B 等含稀疏 MoE 与 Gated DeltaNet 结构的模型进行深度调优,实现 Mac 单机高效运行。
infinitum 资讯聚合
Mercor 与 SkyRL 团队使用 1928 个专家知识工作任务对 Qwen3.5-397B-A17B 进行后训练,将 APEX-Agents Pass@1 提升 70%,证明在规模智能体 RL 中,环境稳定性、精确 token 计算、异步强化学习与 harness 设计与算法选择同样关键。
字节跳动技术团队发布 OpenViking,定位为面向 AI Agent 的统一上下文数据库。它不替代具体 Agent,而是在群聊 AI 同事、Claude Code 等 Coding Agent、豆包工作等办公 Agent 背后提供共享 Context 层。代码、文档、Review 规则可作为 Resource 存入 viking:// 路径,个人偏好、历史判断和 Code Learnings 沉淀为 Memory,可复用方法组织为 Skill,并通过 L0/L1/L2 分层按需加载。任务结束时通过 Session Commit 将新经验自动写回长期 Memory。文章以一名研发的一天为例,演示四个场景:上午在飞书群聊中由 AI 同事结合 OpenViking 完成 PR Review 并自动沉淀 Review 规则;下午在 CLI 中用 Claude Code 深度 Coding 并把实现理解与 Code Learnings 写回 OpenViking;随后回到飞书让群聊 Agent 和豆包工作共享同一份代码结论继续协作;周五由豆包工作从 OpenViking 拉取本周 PR、任务
vivo互联网服务器团队复盘海外电商平台近四年线上性能治理实践。起因是某国家首次大促扩容部署失败且Redis内存告警被淹没,随后在板球赛日遭遇6节点Redis全集群灾难级内存告警。团队沿四条主线推进根治:扩容方向建立预案与CDN及nginx按国家路由的流量隔离;Redis配置经历四轮迭代,先后修复连接池maxTotal过小、后台scan命令在高并发下单线程串行挤压、Spring Session与业务Redis共用集群导致连接池互相抢占,以及Pipeline批量读在maxTotal=50、maxWaitMillis=1000ms下高并发瞬间打满连接的隐性超时;代码层将800字段的大Hash热key拆分为按规格独立的String key并叠加本地热点缓存,把单节点Redis CPU从99.97%灾难告警彻底消除;黄牛防控从WAF封禁、IP段封堵、账号黑名单,最终走到confirm接口入口前置商品下架与无库存校验,使submit请求量下降5倍。文章提炼出分层应对、先止血再根治、告警上推两层找根因、工具链复利、无效流量即性能预算五条方法论。
本文系统介绍了AI Agent应用精细化评测体系的设计与工程实践。传统依赖文本相似度的粗粒度评测无法定位Agent链路中的具体问题,作者团队针对商品中心Agent构建了覆盖质量、成本、性能三维度的评测框架,按感知、规划、记忆、工具四大模块逐层拆解指标,包括任务完成率、幻觉率、意图识别准确率、路由决策准确率、工具调用成功率等共计35项指标。评测体系围绕8类数据集(基础技能、知识问答、多轮对话、异常输入、工具调用、多意图、模糊意图、长对话衰减)展开,采用LLM-as-Judge作为自动评判手段,通过单一职责、先推理后判断、负例引导、结构化输出四项Prompt原则确保评判一致性,并设计主指标机制决定用例通过与否,避免下游指标被上游路由错误污染。文章详细阐述了执行引擎的Trace采集、E2EREAL/E2EMOCK双模式、重试容错、并行调度,以及可视化评测看板的构建。最终平台通过评测数据配置、指标配置、Graph场景配置实现能力解耦,支撑多Agent应用低成本接入,并规划了变更即评测、趋势追踪、多模型A/B测试、评测集自演化四个未来方向。
浙江大学AiXM课题组、vivo BlueImage Lab与之江实验室联合提出轻量级扩散超分模型TinySR,面向真实世界图像超分与移动端部署。文章从四个方向重构扩散超分管线:主干网络采用深度剪枝并引入可学习概率mask与Dynamic Inter-block Activation,配合Expansion-Corrosion策略实现渐进式结构优化;VAE通过通道剪枝、移除注意力模块和引入SepConv实现约10倍推理加速与约22倍MACs降低;移除时间和提示相关模块使模型更专用;并通过pre-caching进一步压缩运行时延。实验显示TinySR相比教师模型TSD-SR实现最高5.68倍推理加速、参数量减少83%、MACs降低84%,在LPIPS、DISTS、FID、NIQE、MUSIQ、CLIPIQA等指标上保持竞争力,为扩散超分走向手机相册增强、视频帧超分等真实落地场景提供了端云协同的端侧前置方案。
京东宣布2026京东全球科技探索者大会(JDD大会)将于9月9日在北京北人亦创国际会展中心召开。届时京东集团将重磅发布物理AI全景战略,邀请行业大咖与技术专家齐聚,围绕技术前沿和产业实践展开讨论,探索AI赋能物理世界的新方向。文章附有扫码报名入口,引导读者关注大会后续动态。
Adobe 周一宣布将 Firefly、Express、Photoshop、Premiere、Acrobat、InDesign、Illustrator、Stock、Lightroom 等应用接入 Slack 的 AI 聊天机器人 Slackbot,并同步上线 Adobe for Slack MCP 应用,集成超过 70 款 Adobe 工具。用户可用自然语言描述需求,Slackbot 会结合会话上下文调用相应 Adobe 工具完成 PDF、图像、视频生成与素材编辑等任务。功能首发面向 Slack Business+ 和 Enterprise+ 团队。这是 Adobe 将创作能力嵌入对话式工作流的最新动作,此前其已为 ChatGPT 推出类似集成,并计划接入 Gemini。Adobe Agentic AI 高级总监 Deepti Pradeep 表示,焦点小组反馈显示用户看重节省时间、跨场景快速达成结果以及在工作场景中随时调用 Adobe 的能力。Canva、Figma 等创意工具以及 Anthropic 等厂商也在加强与聊天机器人和 Slack 的深度集成。
一篇主张 feature flags 可以硬编码的博文在 Hacker News 引发的技术讨论被 News Hacker 聚合整理。原文认为小项目无需复杂 SaaS,用代码或 JSON 配置即可。评论区将 feature flags 拆为开发期开关与面向真实用户的灰度发布两类,支持者强调小团队低成本管理,反对者指出云端并行发布、按比例放量、metrics 观察与回滚需要动态控制。讨论还涉及 config 管理与曝光控制的区分、Quonfig 作为 Git+UI 的折中方案,以及 flag 膨胀治理问题:大量遗留 flag 反映管理摇摆与团队信任缺失,需在上线后尽快删除或在建旗时同步建立删除任务,防止临时开关永久化。术语部分解释了 feature flag、trunk-based development、灰度发布、segments 与 CI 等概念。
挪威正考虑立法禁止带有摄像头的智能眼镜及其他可穿戴设备,以应对日益严重的隐私担忧。数字部长 Karianne Tung 表示,政府正研究如何监管 Meta、Snap 等厂商生产的此类设备。这些可联网的可穿戴产品具备摄像头,未来可能加入人脸识别功能,引发公民自由倡导者批评,被部分舆论称为"变态眼镜"。Tung 指出,AI 与摄像头、麦克风结合并嵌入眼镜、耳机和帽子等日常用品的趋势日益明显,政府必须防止这些设备被用于在公共场所监控他人,包括可能禁止在公共场所对人脸进行识别。她还计划成立专家组,为政府保护公民隐私权利提供政策建议。