banner

长期追踪

持续更新 AI 技术新闻与无线感知前沿。

查看全部
置顶
无线感知前沿
跟踪 WiFi 感知、RF 感知、毫米波雷达、多模态无线感知、跨环境泛化与无线感知落地进展,相关信息由AI自动维护更新。
19 分钟
置顶
AI 技术新闻
本文持续更新AI相关技术,论文,新闻信息,由AI自动维护。
24 分钟

论文阅读

围绕模型、方法和研究趋势整理阅读笔记。

查看全部
热门
Deliberative Alignment: Reasoning Enables Safer Language Models论文阅读
本文解读 OpenAI 的 Deliberative Alignment 论文。论文提出了基于推理的安全对齐新范式:直接教会模型安全规范文本,让模型在回答前显式回忆并推理安全策略。该方法已应用于 OpenAI o 系列模型,在越狱鲁棒性和过度拒答率上实现了 Pareto 前沿改进。
14 分钟
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence论文阅读
本文解读 DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence。论文的核心不是单纯扩大参数规模,而是通过混合压缩注意力、mHC 残差连接、Muon 优化器和配套系统工程,把百万 Token 上下文从能力展示推进到可训练、可推理、可部署的模型设计问题。
15 分钟
SkillRouter: Skill Routing for LLM Agents at Scale 论文阅读
本文解读论文 SkillRouter: Skill Routing for LLM Agents at Scale。论文研究大规模 skill registry 下的技能路由问题,指出完整 skill body 是关键检索信号,并提出一个 1.2B 全文 retrieve-and-rerank 路由系统,在准确率、延迟和端到端任务成功率之间取得较好平衡。
13 分钟

技术实践

记录工程经验、工具链实践和项目复盘。

查看全部
置顶
AI Coding经验总结:从大模型工具到 Agent 工作流
从 SDD、TDD、API 契约、特征测试、安全重构、GitHub Workflow 到 Rules/Spec/Skills,整理一套让 AI Coding 从工具使用走向 Agent 工作流的工程方法。
22 分钟
LLM模型蒸馏与微调实操:Qwen-VL、R1风格推理与Qwen2.5-7B
本文以 Qwen2.5-7B 指令微调、基于 GRPO 的 R1 风格推理训练和 Qwen2.5-VL 视觉微调为主线,梳理蒸馏、SFT、LoRA 与强化学习的关系,结合当前代码说明数据、训练、评估和工程边界。
30 分钟
s1: Simple Test-Time Scaling论文阅读
本文解析 s1 如何以 1,000 条筛选后的推理样本微调 Qwen2.5-32B-Instruct,并通过预算强制在推理阶段控制思考长度。重点讨论数据筛选、Budget Forcing、实验结论及其适用边界。
16 分钟