deep research design —— note
参考link:A Systematic Survey of Deep Research —— github Awesome Deep Research Projects
参考link:A Systematic Survey of Deep Research —— github Awesome Deep Research Projects
上下文归纳正如上文所说,qwen团队发现了其存在的缺陷是优势函数\hat{A}_istoken-level,但是奖励函数是序列级别的,这会导致训练大型、复杂的模型(如混合专家模型MoE)和处理长序列任务时尤为突出,常常导致训练过程不稳定甚至模型崩溃。接下来几篇文章分别从不同的角度去对整体流程进行优化,首先我们先确立一下流程: ...
对齐到RL一个未经对齐的 LLM 可能会产生无益、有害甚至有毒的内容,或者无法理解和遵循复杂、微妙的人类指令。 这一根本性问题被称为对齐(Alignment),即确保 AI 系统的目标和行为与人类的价值观和意图保持一致。 SFT(静态)解决对齐问题的初步尝试是监督微调(Supervised Fine-Tuning, SFT)。SFT 使用高质量的人工标注数据集,其中包含期望的输入-输出对(例如,问题和理想答案),通过模仿学习的方式来调整模型行为。 ...
首先要保证自己的IP是足够纯净的IP,开了v2ray/clash 之后,点开此网站,就能看到IP是否是原生IP且评分如何。 由于gemini和claude对IP的要求高,建议使用原生IP和高评分的节点,且长期只使用这个节点,不然可能会触发斩杀,赔钱有原生IP,但是知道的人太多了,用的人也太多了,上面这个IP是赔钱的。奈云不知道为啥没有,但是我日常用着很舒服,网速很快。 卡在谷歌登录究其原因应该是Antigravity的验证信息不会通过v2ray/clash传入传出,所以只需要把tun模式开了,然后重新打开软件,再登录即可。 需要注意的是个别软件开tun可能要管理员权限,自动重启之后tun其实是没开的,需要再点一次。 然后就能愉快的使用了。如果没有gemini pro,可以去taobao自行购买学生账号,一年估计50-80不等,挺便宜的。
2023年至2025年的研究格局显示,通过将异构生理信号(EEG、fMRI、EMG、EOG、Gaze)与文本、视觉等高层语义模态进行深度融合,领域正在向大脑模型(Large Brain Models, LBMs)和多模态大模型(Large Multimodal Models, LMMs)迁移。 这种范式转移的核心挑战在于对齐问题(Alignment Problem):如何在数学和语义层面统一具有不同时空分辨率、不同拓扑结构以及不同噪声特性的多模态信号。例如,EEG具有毫秒级的时间分辨率但空间分辨率极低,而功能性磁共振成像(fMRI)则相反;视觉和文本数据则处于高度抽象的语义空间。要实现真正的多模态智能,必须解决子空间学习中的流形差异、连续信号的离散化(Tokenization)以及在大模型架构下的深度融合机制。 ...
递归递推时间复杂度:看for的n,取最大 空间复杂度:看实际运行的时候用到了多少内存。 在递归算法中,每次递推都需要一个栈空间来保存调用记彔,因此在计算空间复杂度时需要计算递归栈的辅助空间。 对于递推和递归来说,其实是完全不同的两个思路 递归是“一个实体调用自身” 。这具体表现为一个函数直接或间接调用自身,以解决一个给定问题的更小实例 。递归的本质在于“自我参照”。 递推在此上下文中被理解为迭代计算过程。迭代的定义是“重复执行一组指令” ,通常通过循环结构(如 for, while 或 do-while)来实现 。递推的本质在于“重复” 。 ...
rag 的三个过程: 检索阶段:从外部知识库中提取任务相关的内容 整合阶段:对检索内容进行去重、冲突解决和重新排序 生成阶段:基于精选上下文进行推理以得出最终答案。 Paper note Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs综述围绕两个过程来讲(RAG ⇔ Reasoning): Reasoning-Enhanced RAG:映射高级推理如何优化RAG的每个阶段 RAG-Enhanced Reasoning:展示不同类型检索知识如何为复杂推理提供缺失前提并扩展上下文 ...
agent范式 为了更好地组织智能体的“思考”与“行动”过程,业界涌现出了多种经典的架构范式。在本章中,我们将聚焦于其中最具代表性的三种,并一步步从零实现它们: ReAct (Reasoning and Acting): 一种将“思考”和“行动”紧密结合的范式,让智能体边想边做,动态调整。 Plan-and-Solve: 一种“三思而后行”的范式,智能体首先生成一个完整的行动计划,然后严格执行。 ...
翻译pot翻译 + 百度翻译api 幻觉翻译 dataset阿里开放式多模态AI安全评测基准 OpenMMSec:百万开源多模态数据集
在矩阵的运算中,由于现在LLM Scaling Law,现在模型的矩阵相当的巨大。而计算单元的访存和算力有限,故此通常采用分治的思想进行并行计算,即采用分块的方式进行分块运算,这称之为tile,这里涉及到大量的程序编写的架构和编译器优化,后续我们会展开来这个说。 ...
先说说我的看法,现在各种评价满天飞,我看了看README,其实很好说理解,首先肯定是OCR。 在README中提到两个文件,一个是对image进行OCR,一个是对PDF进行OCR。其最主要的功能就是将其文字和图片进行提取,然后改变为可执行对象。 其次就是对image进行理解,将其转为文字的描述,详细的可以看下图: 我说一下我的思考,受限于我的认知,仅供参考,如果你有更好的想法,欢迎联系我,很乐意跟您进一步讨论。首先是OCR,这个功能的思考肯定源自于多模态大模型的实际业务,对PDF和image的tokenlization是多模态的基础,特别是tob中台的各种文档的token化,这是对agent inference体系中的context engine的PDF给出了一个解法,只要是实际思考过中台文档类的业务,这个是必然要做的工作。 ...
Cuda API创建对象: #include <cuda_runtime.h> #include <cuda.h> #include <iostream> #include <string> // 获取当前机器的GPU数量 cudaError_t error_id = cudaGetDeviceCount(&deviceCount); for (int dev = 0; dev < deviceCount; ++dev) { cudaSetDevice(dev); // 初始化当前device的属性获取对象 cudaDeviceProp deviceProp; cudaGetDeviceProperties(&deviceProp, dev); printf("\nDevice %d: \"%s\"\n", dev, deviceProp.name);</code></pre><p style=""></p><p style="">拿到数据后可以查看对应feature</p><pre><code>printf(" Total amount of shared memory per block: %zu bytes\n", deviceProp.sharedMemPerBlock); printf(" Total shared memory per multiprocessor: %zu bytes\n", deviceProp.sharedMemPerMultiprocessor); printf(" Total number of registers available per block: %d\n", deviceProp.regsPerBlock); printf(" Warp size: %d\n", deviceProp.warpSize); printf(" Maximum number of threads per multiprocessor: %d\n", deviceProp.maxThreadsPerMultiProcessor); printf(" Maximum number of threads per block: %d\n", deviceProp.maxThreadsPerBlock); printf(" Max dimension size of a block size (x,y,z): (%d, %d, %d)\n", deviceProp.maxThreadsDim[0], deviceProp.maxThreadsDim[1], deviceProp.maxThreadsDim[2]); printf(" Max dimension size of a grid size (x,y,z): (%d, %d, %d)\n", deviceProp.maxGridSize[0], deviceProp.maxGridSize[1], deviceProp.maxGridSize[2]); ...