
ACM MM 2026 · FIRST AUTHOR
DyFrFPN + LDM
Towards Accurate Small Object Detection via Dynamic Frequency Suppression with Label Disambiguation
- 自适应过滤频域冗余与噪声
- 抑制歧义样本,提升小目标定位精度
AI ALGORITHM · COMPUTER VISION · MULTIMODAL
把噪声压下去,
让微小目标与真实语义浮现。
不要用几行标签认识我。不要用几行标签认识我。 请从问题、证据与结果开始。请从问题、证据与结果开始。
我关注视觉信息不足时,模型如何仍然看准;也关注跨模态证据分散时,系统如何真正理解一个场景。
EDUCATION · RESEARCH · PRACTICE
从计算机科学基础,到小目标检测研究,再到多模态检索与推荐系统。
B.ENG. · COMPUTER SCIENCE
计算机科学与技术本科。主修数据结构与算法、计算机网络、操作系统、数据库;辅修机器学习与程序设计。
M.ENG. · ARTIFICIAL INTELLIGENCE
电子信息硕士,人工智能方向,GPA 3.61 / 4.0。修读人工智能、计算机视觉、算法设计与分析、数理统计与矩阵理论。
ACM MM · CCF A
提出 DyFrFPN 与 LDM,面向小目标视觉不足、频域噪声干扰及标签歧义造成的定位偏差。
ECCV · COMPUTER VISION
提出 ASD 全频谱特征解耦框架与 CPD 类别原型蒸馏策略,实现频谱噪声抑制与类内一致性增强。
MULTIMODAL ALGORITHM INTERN
为短剧搭建多模态内容理解与场景级语义检索链路,从代表帧、字幕、人脸轨迹到结构化语义标签与 CLIP 双塔检索。
SELECTED SYSTEMS · 04 ITEMS

ACM MM 2026 · FIRST AUTHOR
Towards Accurate Small Object Detection via Dynamic Frequency Suppression with Label Disambiguation

ECCV 2026 · SECOND AUTHOR
Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection

MULTIMODAL SCENE RETRIEVAL
代表帧、字幕时间轴、匿名人物轨迹与 VLM 结构化标签共同驱动场景理解,并训练带 LoRA 的 CLIP 双塔模型。

GENERATIVE AD RETRIEVAL
以 decoder-only Transformer 建模百万级行为序列,为 66 万候选广告构建四层 RQ-KMeans semantic ID。
METRICS · NOT DECORATION
MODELS · SYSTEMS · ENGINEERING
不仅让模型跑起来,也让证据组织、负样本、评估与服务链路彼此对齐。
PyTorch · Transformer · CLIP · LoRA · InfoNCE · SFT · RLHF · PPO / DPO / GRPO
双塔召回 · ANN · Wide & Deep · DeepFM · DCN-v2 · DIN / SIM · MMoE / PLE · ESMM
Python · C++ · Java · Docker · Git · Linux · Faiss · vLLM · SSE · 全栈开发
Hard Negative · 特征快照 · AUC / GAUC · Scaling / Ablation · 冷启动 · MMR / DPP
INVENTION PATENTS · 01 GRANTED / 02 PENDING
CN119420856A → B
CN121256525A
CN121438628A
信息据公开专利记录整理,法律状态以国家知识产权局最新登记为准;点击条目查看公开记录。
OTHER RECORDS / 其他记录