标签 / 模型研究
LLM
-
V2er 眼中的失败意义:瀑布、直升机与地图 整理 V2EX 热帖:菲尔兹奖得主警惕 AI 攻破数学难题。评论区用徒步/直升机、抄答案、游戏开图、造起重机等比喻,把「失败的价值」讲成可转述的画面。 -
V2er 眼中的蒸馏:鱼桶、后厨与临摹 整理 V2EX 热帖:蒸馏像不像「钓别人鱼桶里的鱼」?评论区用饭店后厨、临摹、租车拆解、奶茶配方等比喻,把技术词砸成可转述的画面。 -
普通人何时能感到 AI:圈内像电,圈外还是四舍五入 Nathan Lambert:AI 革命可能持续百年,但普通人日常几乎无感。收益太间接、政治反弹像恩格斯停顿。真正标记进化的是深度采用,不是会聊天。 -
外星心智:对齐未解,不能全速扩模型 OpenAI 首席科学家:AI 是长出来的外星心智;目标对齐≠价值对齐;CoT 监控变弱。没有实验室已把对齐做到可长期全速扩。 -
ChatGPT 让答案更好,批判性思维让想法更宽 Bocconi 与 OpenAI 的千人随机实验:AI 负责打磨与专家形,因果推理训练负责原创与发散。两者互补,评估体系却还卡在旧量表上。 -
AI 会不会让总岗位变少?一张表讲清生产力与需求 整理 V2EX 热帖:岗位增减的直接原因是需求而非生产力;「欲望永远跑赢 AI」是大胆猜想,评论区用有效需求与通缩把它拆开。 -
Agent「自我改进」到底改进什么?Warp Skills 环 vs OpenAI 黑板 结合 Anthropic×Warp、宝玉解读与 Turing Post:可落地的是人类反馈驱动的 Skill 更新环,不是经典 RSI;共享记忆会让系统更强,但改权重仍未证实。 -
DeepSeek Engram:条件记忆——大模型稀疏性的新轴 解析 DeepSeek Engram:用 O(1) 查表补上 MoE 缺失的「条件记忆」,同参同算力下推理与长上下文提升往往比背知识更大。 -
软件不是文件:KDC 说找到材料 ≠ 获得知识 vivo 肖博 KDC 系列第二篇:Representation 不等于 Knowledge。旧版退款政策被 RAG 高分召回却答错——问题在版本、证据、成熟度与适用边界,而不只是向量检索。 -
Nvidia 的危险生意:AI 基建融资已进入危险区 Stratechery 深读:从 1873 铁路债券到 hyperscaler 发债与 Google 股权融资,再到 Nvidia 拉养老金建 $5000 亿 GPU 融资平台——每一层融资都比上一层更紧张。 -
防御窗口收窄:OpenAI 扩展 Daybreak 与 GPT-5.6-Cyber 攻击方将用 AI 规模化发动网络战。OpenAI 推出 Daybreak Blue/Red 分层访问与 GPT-5.6-Cyber,高级网络任务完成率从 1.5% 拉到 95%,并在 V8 等真实代码库中发现 CVE。 -
监控看起来正常,答案却在变差:AI 网络里的延迟是正确性问题 错误率不变、答案变差——RAG 优雅降级与 Agent 超时截断让延迟成为质量信号。TTFT、尾延迟、分阶段检索监控与 SLO 怎么设。 -
Agent 敢放手的前提:Stack Overflow 谈 AI 上下文架构 上下文架构不是 RAG 管道,而是护栏、Scope、信任分与人机回环。Stack 工程与产品负责人拆解基础设施/架构/工程三分法,以及自建时常被低估的冲突消解与可预期性。 -
AI界最强CP翻车了?4B小模型吊打671B巨无霸,秘密竟是... DeepSeek教会了AI「深度思考」,但清华团队说:光Deep不够,还得Wide!4B模型凭什么比肩671B?答案藏在计算机最经典的CP里