扫描下载APP
其它方式登录
DeepSeek V4 Pro正式版(代号0813)上线引发争议,官方宣称性能大幅提升甚至媲美Claude Fable 5,但独立评测显示其实际智能指数仅53分,多项测试不及竞品;实测‘鹈鹕测试’效果反不如V4 Flash,疑似模型未真正更新或依赖未发布的DeepSeek Harness框架;文章同时分析DeepSeek以低价高性价比推动行业‘斩杀线’,倒逼OpenAI、Anthropic等大幅降价,并探讨推测解码与静态知识剥离等降本技术趋势。
文章实测DeepSeek V4 Pro正式版在文本生成、商务邮件撰写、前端开发及复杂交互编程等场景的表现,指出其能力提升明显但惊艳感不足;重点强调其Agent框架Harness的战略意义,即通过模型路由(Flash与Pro协同)优化成本效率,将模型价格优势延伸至完整智能体系统。
文章聚焦AI大模型领域动态:Claude Code默认启用自动模式,标志AI编程从辅助转向自主执行;谷歌被曝悄悄取消Gemini 3.5 Pro,反映其模型策略收缩;Meta开源轻量级30B模型Muse Glimmer降低本地部署门槛。同时指出AI热潮正加剧硬件供需矛盾,如存储芯片涨价、算力成本攀升。
文章揭示当前国产开源大模型(如Kimi K3、DeepSeek V4-Pro、GLM-5.2、Qwen 3.8)虽免费开源,但完整部署需巨额硬件投入(数百万至三千万人民币)、高电费、液冷机房、专业运维团队及英伟达高端GPU,且受限于出口管制与国产芯片生态短板;实际推理效果远逊官方API,因核心推理优化、KV缓存、动态批处理等关键技术闭源。
苹果Mac产品线正因AI发展出现结构性分化:一类是面向人类交互的AI终端(如带OLED触控屏的MacBook Pro、MacBook Air),强调屏幕、便携与人机交互;另一类是面向AI Agent持续运行的‘AI主机’(如Mac mini、Mac Studio),强调大内存、高带宽统一内存、远程管理与7×24小时稳定运行。内存容量成为新核心门槛,芯片迭代与产品定位均围绕本地AI需求重构。
商汤在WAIC 2026发布日日新SenseNova U1 Pro多模态模型,主打原生8K超长图输出、图文交错思维与端到端交付能力,可自主完成理解、规划、生成、检查与修正全流程,面向信息图、城市规划、影视分镜等商用场景,标志AI生图从单点生成迈向系统级内容交付。
谷歌原定48小时内发布的AI大模型Gemini 3.5 Pro(代号Cappuccino)因编码能力未达内部标准而紧急延期数月,暴露其官僚体系拖累创新、算力分配失衡、AI编程落地受阻及人才流失等深层问题;该事件折射整个行业面临‘下一代巨模型失望陷阱’,即模型规模逼近极限导致性能提升乏力、投入产出比恶化。
MiniMax完成160亿港元融资,获多家国际主权基金及长线机构支持;创始人闫俊杰承诺实现AGI前不领薪酬,并推出股权激励与开源基金;公司正推进2.7万亿参数M3 Pro大模型,算力布局覆盖海外与国产双线,国际大行给予‘买入’评级并看好其商业化与回A前景。
iPhone 18 Pro Max硬件成本较上代上涨近300美元,主要因首发2nm工艺的A20 Pro芯片代工成本飙升及12GB LPDDR5X内存与1TB存储价格上涨,二者成为成本攀升核心驱动,涨幅远超往年迭代水平。
字节跳动Seed团队发布多模态图像创作模型Seedream 5.0 Pro,重点升级图文匹配、结构合理性、文字渲染与画面美感,在复杂信息可视化、交互式精准编辑、真实影像质感及原生多语种生成方面取得进展;实测显示其在商业海报、真实摄影、局部编辑等场景表现稳定,但中文文字渲染、复杂UI设计及高保真社交截图仍存短板。
至简动力由三位前理想汽车智驾核心成员创立,一年内完成首款全场景机器人i7 Pro百台交付,创具身智能行业最快纪录;其全球首个CNC智能化具身机器人产线实现硬件自举闭环,通过与绿的谐波深度协同攻克工业恶劣环境适配难题;产品以22.98万元高性价比切入机加工、柔性PCB、光模块等真实工业场景,构建数据闭环、模型迭代与通用本体平台,定位机器人时代基础设施公司。
文章揭示AI领域对Agent的普遍误区:过度关注模型本身而忽视外层执行机制(Harness)的重要性。实验证明,仅优化Harness(如代码逻辑、文件处理、流程编排),不改动模型权重,即可使DeepSeek-V4-Pro在法律任务中综合得分从3.5%跃升至80.1%,性能提升达76个百分点,甚至媲美顶级闭源模型。Karpathy的Loop Cycle实验进一步表明,自动化迭代循环(提出修改-运行-评估-保留)可大幅提升系统持续进化能力。
谷歌Gemini 3.5 Pro模型泄露,主打前端代码与视觉生成能力跃升,可一次生成高完成度UI、精准SVG及Three.js三维场景,性能超越Fable 5;但在硬核推理、长程任务和工程调试上仍落后于Fable 5和GPT-5.6。该模型基于全新预训练底座,7月17日或将正式发布。
苹果因印度代工厂塔塔电子遭黑客组织World Leaks网络攻击,致630GB机密文件外泄,涵盖iPhone 18 Pro设计图纸、A20 Pro芯片技术细节、C2自研基带及供应链信息,严重冲击其保密体系与印度制造战略,引发全球关注与紧急响应。
文章聚焦华人学者陈文虎及其团队开发的AI模型评估基准MMLU-Pro、MMMU和MMMU-Pro,揭示其如何通过重构题目难度、选项设计与多模态任务设置,解决传统评测失准问题,成为行业通用标准;同时介绍其学术背景、实验室工作及对基础模型评估体系的关键贡献。