国产成人高清在线_日韩一区二区三区中文字幕_欧美大视频在线看免费视频_中文字幕在线视频免费

首頁 > 以車會友 > 以車會友 > 復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

發布時間:2024-09-16 16:25:38來源: 13041198719

平安證券近日發布AI動態跟蹤系列(三):復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍。

以下為研究報告摘要:

9月13日,OpenAI正式發布并上線o1系列模型o1-preview和o1-mini。

平安觀點:

OpenAI計數器重置回1,o1系列開啟復雜推理序幕。本次OpenAI發布的是o1-preview(預覽版)和o1-mini(擅長STEM、更快、更便宜)兩個版本,ChatGPT付費用戶和API用戶可以使用。根據OpenAI官網介紹,o1系列被定位為用于解決難題的推理模型。對于復雜的推理任務來說,OpenAI認為o1是一個重大進步,代表了AI能力的新水平,鑒于此,OpenAI將計數器重置回1并將此系列模型命名為OpenAI o1。OpenAI研究發現,隨著強化學習(訓練時計算)和思考時間(測試時計算)的增加,o1的性能會不斷提高。因此在體驗上,與此前模型不同點在于,OpenAIo1在作出反應之前,需要像人類一樣,花更多時間思考問題。

o1基準表現明顯優于GPT-4o,數學與編碼能力實現飛躍。OpenAI實驗結果表明,在絕大多數推理任務中,o1的表現明顯優于GPT-4o。尤其是在具有挑戰性的推理基準上,o1實現了能力飛躍,1)數學能力:在美國數學奧林匹克(AIME2024)預選賽題目中,GPT-4o平均只能解決12%的問題,o1正式版達到平均74%的準確率,在使用學習評分函數重新排名1000個樣本后準確率達到93%,相當于美國排名前500的學生水平。2)編碼能力:在競爭性編程問題(Codeforces)比賽中,o1-preview、o1分別超越了62%、89%的人類競爭者,而對比GPT-4o僅超過11%。3)特定專業領域能力:GPQA diamond測試(專門用于評估模型在化學、物理和生物學等領域的專業知識水平)中,o1不僅成功完成了測試,更是超越了人類專家的表現,成為首個在GPQA diamond基準上擊敗人類專家的AI模型。

o1引入思維鏈優化邏輯推理,助力模型性能與安全提升。o1優越能力的背后,核心突破在于運用思維鏈(chain of thought)方法來處理復雜任務,OpenAI介紹到,類似于人類在回答困難問題之前可能會思考很長時間,o1在嘗試解決問題時會使用思維鏈。通過強化學習,o1學會打磨其思維鏈并改進它所使用的策略。o1學會了識別和糾正錯誤,學會了將棘手的步驟分解為更簡單的步驟,學會了在當前方法不起作用時嘗試不同的方法,此過程顯著提高了模型的推理能力。在OpenAI的一個官方演示中展示了o1-preview解答復雜問題的邏輯推理過程,o1-preview在過程中逐步顯示思考、翻譯問題、定義變量、理解問題、構建方程、解方程等與人類推理相似的步驟,最終輸出結論。同時,OpenAI認為思維鏈推理也為大模型安全性的提升提供了新思路,o1-preview在關鍵越獄評估和用于評估模型安全拒絕邊界的最嚴格內部基準上取得了顯著的改進。

投資建議:OpenAI推出專攻難題的o1系列大模型,應對復雜推理任務,o1引入思維鏈(Chain of Thought)提升邏輯推理能力,絕大多數基準表現不僅明顯超越GPT-4o,而且在數學與編碼能力上實現了重要飛躍,在理化生等專業領域的知識水平也達到新高度。OpenAI的動向始終引領全球大模型的發展,我們認為o1的正式亮相有望開啟復雜推理大模型的序幕,一方面對算力提出了更大需求,同時也將賦能下游AI應用(如編程、教育)的快速迭代。我們堅定看好AI主題的投資機會:1)算力方面,推薦工業富聯、浪潮信息、中科曙光、紫光股份、神州數碼、海光信息、龍芯中科,建議關注寒武紀、景嘉微、軟通動力;2)算法方面,推薦科大訊飛;3)應用場景方面,強烈推薦中科創達、恒生電子、盛視科技,推薦金山辦公,建議關注萬興科技、福昕軟件、同花順、彩訊股份;4)網絡安全方面,強烈推薦啟明星辰。

以車會友更多>>

2024年佛山市禪城區國有資產監督管理局下屬企業招聘工作人員公告(2人) 2024年“惠”聚優才——惠城區高新園招聘編外工作人員通告(4人) 2024年潮州市衛生健康局直屬醫療機構赴廣東醫科大學招聘工作人員公告 2024年臺州溫嶺市交通旅游集團有限公司招聘編外工作人員公告 聯想即將發布moto新千元機,4nm芯+光學防抖+IP68,AI功能強大 《索尼中國可持續發展報告2024》在第七屆進博會上發布 紅米Note14Pro+和紅米Turbo3哪個好?我們應該怎么選? 紅米note系列、k系列,到底哪個系列更值得買? 紅米“不講武德”,Note13Pro+跌落神壇,1819供不應求 國外科技媒體評測小米15:目前最好的小屏旗艦手機 小米15系列銷量火爆!盧偉冰直播透露首銷佳績及小米之家擴展計劃 華為新手機設置這六個更流暢,這些設置讓你的手機飛起來 OPPO“不講武德”,抗摔直屏+5500mAh+100W,512GB跌至1581元 邁騰 B9,是否值得你的傾心? 1-9月緊湊型轎車銷量榜單變天了 七款國產轎車進前十 軒逸第二 蘋果發布 iOS 18.1 RC 版,正式版下周見 安卓15來了!谷歌放大招,手機刷新率玩起了\"變臉\"游戲 華為余承東:鴻蒙智行正式發布一周年,累計交付突破50萬輛 vivo X200、X200 Pro、X200 Pro mini參數大比拼,你更喜歡哪一款 VIVO“不講武德”,X100SPro跌落神壇,成雙11黑馬! 榮耀“不講武德”,200系列跌落神壇,1999供不應求 5299元一加13開箱體驗,為什么說是最均衡的國產旗艦手機? 各品牌手機多少錢入手最合算?請看本篇雙十一全品牌手機抄底攻略 手機買對不買貴,這3款堪稱“撿漏”,一步到位能用6年 盤點雙11旗艦機價格跳水王:2024雙十一手機高性價比推薦排行榜 BC陣營大合體!愛旭、隆基、TCL中環要在珠海搞點事? TCL智能鎖體驗怎么樣?K7G Plus用了一段時間后,有些話不吐不快 索尼PSN港服迎“雙十一”游戲折扣活動 紅米K80系列和iQOO Neo10系列哪款手機更值得購買? 120倍變焦!真我GT7Pro首銷3599元起,影像體驗如何?