小米MiMo-V2.6强化学习训练过程公开,罗福莉确认后续开源技术细节
9月17日凌晨,小米MiMo大模型团队负责人罗福莉在X平台发文,首次公开了旗下最新大模型MiMo-V2.6的强化学习训练进展,同步上线实时训练页面,把大模型RL阶段的全流程摊开给外界看。
技术架构上,MiMo-V2.6正在开展大规模多任务智能体RL实验,从算力、环境、评估三个维度全面扩展:算力层面实现单步约20亿Token的完全异步并行,环境层面搭建支持单次运行混合多框架的代理式RL,评估层面采用带测试用例与量规奖励的组内信用分配机制。
直播页面实时呈现训练进度、Token消耗与成本指标,其中MiMo-V2.6-Pro版本训练约1天19小时、耗资89万美元,MiMo-V2.6-Flash时长1天14小时、耗资39.7万美元,双版本累计训练成本已突破128万美元。
罗福莉确认相关技术细节将在未来数周内逐步开源。作为从DeepSeek引进的核心AI人才,罗福莉曾主导达摩院多语言预训练及DeepSeek-V2研发,去年11月加盟小米后执掌MiMo团队,今年3月上一代万亿参数模型Mimo-V2-Pro已登顶Artificial Analysis全球大模型综合智能榜第八位。
这次透明化直播与工程细节开源,把前沿大模型训练从“黑盒试错”往“极客级过程开源”推了一步,后续开源落地情况值得持续关注。
模型地址:小米MiMo官网

抖音上线“冒用声音”专属举报入口,AI克隆音色投诉投诉量一个月翻倍
9月17日,抖音正式上线“冒用声音”专属举报入口并升级相关维权机制,回应AI生成技术普及后频发的声音侵权问题。平台在“侵犯权益”分类下增设“冒用声音”专属通道,配套推出可核验的举证机制与双向申诉流程,实现了从入口建立、证据核验到最终判定的全链路闭环。
用户可通过PC端“抖音批量侵权举报”网站发起投诉,支持两种举证方式:
一是语音录入,权利人现场朗读平台随机文案录制10至30秒语音,系统校验语音特征与朗读内容一致性;
二是上传包含权利人清晰可辨原声及正面肖像的视频。平台可直接比对提交的音视频材料研判声音相似度,被举报方也可通过App站内信发起申诉,提交声音使用授权、AI合成授权等材料。
抖音平台数据显示,近一个月内涉及声音侵权的举报量同比翻倍,此前专项治理中已累计下架AI侵权视频超53.8万条,其中AI肖像及声音侵权视频达8.5万条。
根据《民法典》第1023条,声音权已参照肖像权受到法律明确保护,此前国内首例AI声音侵权案判赔金额已达25万元。这次升级把平台对AI深度合成内容的管控从版权治理扩展到了生物特征与人格权益防护,后续App端声纹识别能力的落地效果值得关注。
详情查看: https://www.aitop100.cn/infomation/details/34720.html

阿里云Wan3.0视频大模型升级:单条直出30秒长镜头,支持五条视频参考
阿里云近日正式对外展示全新升级的Wan3.0视频大模型,实现了从早期生成数秒短片段到直接输出单条30秒长镜头的跨越,同时推出支持导演级控制、最多引用五条视频的omni-reference核心能力。
回顾视频生成技术发展,行业过去长期围绕5秒左右短片段打磨,随后逐步延伸至15秒,Wan3.0的30秒单条直出能力让AI视频开始适配影视行业真实生产流程,制作团队无需再费力拼接成百上千个零散短片段,可直接生成连贯长镜头后按剧本剪辑。
核心功能上,Wan3.0支持同时引入多达五条视频作为参考素材,配合最多10张图片、5段音频的组合参考,实现角色五官、服饰、道具细节、空间关系、光影风格的像素级一致。
模型还首次支持doc、xls、ppt、pdf、md等办公文档格式直接输入,可自动解析文档内容生成配套动态画面、字幕与背景音效,实现“文档直转视频”。人像生成方面做了针对性优化,精细刻画五官、皮肤纹理及微表情,降低人物崩坏和画面穿帮概率,同时原生支持生成带语音的双声道视频,人声、背景音乐与画面节奏自动同步。
目前Wan3.0相关能力已通过Model Studio以及Qwen Cloud面向开发者和企业用户开放API接口,已在短剧影视、广告营销、文旅传播等多个行业落地应用。
详情查看: https://www.aitop100.cn/infomation/details/34719.html

Anthropic合并Claude产品线:Cowork与Chat合为一体,统一办公入口
Anthropic近日宣布将Claude Cowork和Chat全面合并为统一的Claude,整合了Cowork、Design、Docs、Slides等全部能力,用户无需再纠结任务入口,历史对话、Skill和连接器也得以保留。
新版Claude能自主判断任务复杂度并调用对应能力,可在后台持续推进任务,未来几周将向Pro和Max用户推送。这次合并打破了传统人机交互模式:Claude从“回答窗口”变成“成果空间”,用户在聊天框内就能完成文档起草、幻灯片制作、视觉设计等操作,内容保持在同一上下文中,还支持修改、批注、导出和分享。
以前Chat和Cowork在产品上分得很清楚,Chat是聊天框,问问题、改文章、分析文件,回答完一轮基本结束;Cowork则更像把一件事直接交给Claude,比如整理报告、查资料发邮件,它可以自己搜索网页、读取文件、写报告一步步做完。现在两者放进同一个入口,用户输入需求后Claude自己判断是直接回答还是进入长Agent任务,原本隔开的上下文也开始打通,普通聊天随时可以变成长任务,不需要“搬家”。
Claude Docs类似在线文档,可直接生成可继续编辑的富文本文档,支持多人实时编辑、评论@Claude修改;Claude Slides将做PPT功能单独拎出,可直接把文档转成结构化演示文稿;Claude Design的视觉设计能力也进入普通对话。
这反映出AI巨头正在争夺AI时代新的操作系统入口,产品竞争逻辑转向让用户看到最少选项、由AI吸收复杂性,Agent正在成为AI产品的基础架构。
官网地址:Claude官网(海外网站需要科学上网)

Manus拟融资约5亿美元,目标估值40亿美元
据彭博社报道,中国创立的AI初创公司Manus正计划进行一轮约5亿美元的融资,目标估值约40亿美元,这将是其与Meta Platforms完成业务层面切割后的首次融资。多位知情人士透露,该轮融资预计很快就会落定,可能让Manus估值翻倍,使其成为中国估值最高的AI智能体初创公司,不过谈判目前仍处于早期阶段,交易条款仍可能调整,潜在新投资者身份尚未明确。
Manus此前的股东背景颇为豪华,囊括腾讯、红杉中国以及真格基金等一线机构,截至目前相关机构负责人均未对此事作出回应。此次潜在融资发生在Manus与Meta解除合作之后,双方已于今年5月完成业务分离并停止数据共享,本月早些时候Manus表示已恢复独立运营,由创始团队继续领导,面向全球用户开发生成式AI智能体产品。
若按40亿美元估值融资落地,Manus在中国AI智能体开发者中的位置将更稳,也可能为未来在香港上市铺路。其竞争对手Evoken正以据称30亿美元的估值融资,产品为AI设计智能体Lovart。
但Manus仍面临更广泛的基础模型厂商竞争,月之暗面的Kimi、Anthropic的Claude等产品在处理通用桌面任务方面能力越来越强,而Manus并不从零开始训练自家的底座模型,后续能否撑住这一估值,取决于产品落地和用户留存情况。
工具地址:Manus官网 (海外网站需要科学上网)

豆包大模型2.1 Pro 0915版更新:幻觉大幅降低,Agent复杂任务交付更稳
豆包大模型2.1 Pro近期迎来全新的0915版本升级,本次更新将核心焦点锁定在实际生产工作场景中,通过系统性地降低AI幻觉、强化证据溯源以及提升多任务处理可靠性,为企业级用户和开发者带来更具生产力价值的AI体验。在应对复杂业务场景时,新版本通过强化证据溯源机制,优先调用权威来源的信息,结合时效判断与交叉数据核验,让Agent在执行复杂任务时更加忠于事实。
以金融投研场景为例,模型可以自主拆解宏观或微观研究需求,调度数百个子Agent同步检索成百上千个网页,引入卫星影像、船舶航迹等多维度外部交叉资料进行佐证,确保最终生成的每一条研究结论都能溯源到对应的原始证据。
多模态编程与代码工程理解能力也迎来同步进化,面对体量庞大的代码仓库,新版本能够清晰理清跨文件的复杂依赖关系,精准定位Bug根源并给出修复方案,开发者只需提供操作录屏或几张手绘草图,系统就能将其转化为可运行的网页、游戏逻辑或三维场景代码。
视觉与多媒体理解方面,新版本能够完整看完长视频内容,跨帧提取关键信息,并严格对照标准作业程序查找现场操作中的问题,适配工程图纸解读、教学实验分析以及产品质量检测等专业领域。
值得一提的是,系统对运行效率进行了深度优化,图像与视频推理阶段的Token消耗量相比上一代大幅下降30%以上,有效压低了实际业务调用的运营成本。目前该版本的API已经正式在火山方舟上线,用户也可以直接在豆包工作中切换体验。
工具地址:豆包AI官网

腾讯ChatterFly低调内测:桌面语音输入可直接生成邮件、周报和开发提示词
近日,腾讯正低调内测AI原生语音/表达工具ChatterFly,部分资料称中文名或叫“元宝输入法”,当前开放macOS、Windows桌面客户端,需内测码进入,iOS与Android标为“即将发布”。
与常规输入法只做“语音转文字”不同,ChatterFly把表达辅助前置到输入环节:默认Fn键唤起语音录入,短按或按住说话,再次Fn或双击可下AI指令,如“写周报”“生成开发提示词”。
首页集成输入统计、个人词库、语音历史、Skills与设置,顶部展示总字数、语音占比、语音速度、节省时长等行为数据。Skills是核心模块,首期内置会议纪要、工作汇报、项目推进、营销文案、邮件润色、VibeCoding提示词优化等能力,按开关启用并结合上下文重写。
实测中,口述聚餐安排可自动分时间、地点、交通、后续事项;口述“做昆虫识别App”可输出页面结构、数据边界与验收标准,直接交给开发Agent。个人词库支持语音改词后自动记忆,也可手动加专有名词,并支持授权一键迁移搜狗词库,但含数字符号的词汇在拼音场景下可能不生效。
官方资料称产品适配弱网、嘈杂、轻声环境,依托混元等大模型能力沉淀用户习惯。业内认为,它延续腾讯搜狗、微信输入法之后的“AI表达”支线,但内测阶段生成质量、专业术语准确性与幻觉控制仍待正式版验证。
目前腾讯在输入法赛道已有搜狗输入法、微信输入法两款成熟产品,ChatterFly的入局意味着腾讯正在多产品卡位AI表达辅助赛道,后续正式上线后的市场反馈值得观察。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:











