强化学习
技术强化学习,AI通过与环境交互试错来优化决策策略的方法论,典型应用包括AlphaGo、机器人控制
508 次提及375 个连接首次出现: 2026-03-31最近出现: 2026-07-29
关系图谱
关系 (397)
使用技术 (300)
DVDFGLM-5具身智能Psi-R2Psi-W0VeroGenie SimORCA Lab 1.0Genie Studio AgentLatentUM深度求索 DeepSeekNVIDIAAWE3.0GO-2基础模型追觅DAPOABot-N0SocialNavSudo R1IHIQLICRLGCMBCNMRGenie Envisioner 2.0ADS隐空间世界模型破壳机器人Momenta R7talkieLWDGPT-5.5VFAGPT-5.1DeepSeek V3.1NB-CellGS-PlaygroundGPT-4DeepSeek V4NB-CellPrefix RLAgent-World-14BDeepSeek-V4-FlashOxygen VisionLfHV视觉语言导航AgentDreamerV3Physical IntelligenceHarnessHelixHelix 2MicrosoftREFORMHiLightUniDoc-RLLaST-R1Stellaris-VL-4BCodePercept-8BTBA框架Hy3 previewE-TTSClaude Opus 4.6Qwen3Muse Spark灵初智能HTDOpus 4.7Helix 02MuseSparkPoliFormerRing-2.6-1TWorld-R1GIPOAcceRLDeepSeek R1Composer 2.5Composer 2.5SU-01HyperEyesOpenAIAnthropicGPT-5Atlas驭势科技百炼DeGVLAOneModel 1.7 FrontoStria-RLEcho-N1OPPOGigaBrain-0.5M*Agentic RL百川M4逆矩阵科技Grok V9-MediumAlphaProofGPT-5.6SkyClaw-v1.0SOFisherAlphaProof NexusUnified Thinker他山科技AcceRLFAM系列SUGARVTLA模型M2RLRSAgentClaude MythosGigaBrain-0MetaAgent-XDiffusionOPDSenseNova-U1-8B-MoT-Infographic生成认知Flex 2MindverseAlphaGoAlphaFold百灵 v2.6SunoSRC系列控制器银河通用OntoZ混元3RLaaS发布MANGOUniSim-RealUniLab新程AlphaPhysWorldRinna新程 Alpha阿里巴巴AlpaGym阿里千问高考志愿填报AgentOpenClaw千问高考志愿大模型PPOPhi-Bot X1KairosRobust-U1世界模型AlphaZero悟界·Physis-v0.1Kairos-4BGPT-3BudgetMem摩尔线程AlphaEvolve光象科技宇树G1SkyReels V4HyVLA-0.5HY WorldDM0MiniMax-01Qwen2.5Physis-v0.1灵心巧手星海图Cursor 新模型九章云极DeepSeek-R1-Distill-Qwen-1.5BDeepScaleR-1.5BAI工厂QwenLLaMAVibeThinker-3BAstraBrain WAM 0.5训练工厂Spectrum-to-SignalMGPOCodex AgentPixVerseR1Alaya NeW AI工厂Qwen2.5-3BQwen3-30B-A3BUniRLG0.5 VLAPhi-Bot X1slimeM4 医学增强模型Fugu UltraStellaris-VL-0.8BFugu正行创新Seed2.1MomentaR7世界模型Unitree H2TRMSocraticPO智元机器人DreamX-World 1.0JalapeñoAlphaChipVideoTemp-o3WorldPlayPhoneBuddy-4B子曰3子曰4全要素大模型MirendiFugu UltraUI-TARS-7B-SFTPatronus AI瓦特跳动GLM-5MWA™Grok 4.5DINOv3PI0.6VLX-GoWALL-BCursorDenseWorldRM-R1机器心智理论乐享科技AReaL 2.0UranusDelTAIneffable IntelligenceTaRO框架AdaJEPACLARITYClaude Fable 5DeepSeek R1-Zeroo3GDK影智EquiLibre TechnologiesComActormorphSkild AIOpenRLT*World of BitsGoogle DeepMindCosmos腾讯混元Hy3混元 Hy3Muse ImageTwinRLLingBot-VideoGoogle量子AI团队策略梯度NovasiliconDM0.5GoogleMamoda 2.5DFOL2.0Evo-RLTDeepSeekXspark AIMuse Spark 1.1GraphPlannerUnityMAS-OKAT-Coder-Pro V2.5非对称PPOUFOOak LabEponaV2银犀 Rhino-Z1InklingDW0.5无问芯穹查新检索AI AgentAlphaProof双向神经旁路系统Infographic-V3RLinf爱学大模型VGGRPOPolar字节跳动World EngineRISEMaster2000 GEN2Gravity 4D WAM吉利16合1智能电驱CutawaMureka v9.5U1 ProMoE-236BMacaron-V1Kimi K2Macaron V1ADANESMarcaron V1力控OvisOCR2腾讯AI搜索DSO.aiMAI-Cyber-1-FlashVTLAQwen-Image-Edit-2511
应用于 (72)
AI AgentAI金融人形机器人广告推荐机器人AI教育具身智能代码生成视觉推理ViVa自动驾驶AI安全Agent开发者大会自动驾驶家庭机器人AI对齐AI竞赛医疗AIAI芯片Tool UseAI科研助手多模态理解视觉语言导航图像生成AI推理VortrixLenVM数学推理文档理解AI编程助手GRPO模型蒸馏药物发现视频生成PACEAI搜索边缘计算POMDP部分可观察马尔可夫决策过程AI客服世界模型检索增强问答竞赛代码任务模仿学习计算精神病学AnthropicRLHFRLAIFDPO机器人开源可解释AI视觉语言大模型工业AI扩散模型情景记忆音乐生成Vera CPU工厂RLHF脑机接口智能体决策发布会AI AgentAGI具身智能深度求索 DeepSeek无问芯穹LoRA安全监测芯片设计
就职于 (1)
合作 (1)
领导 (1)
相关文章 (508)
下滑加载更多...(已显示 30 / 508)