KeyFrame內部研究專用

Midjourney Update | June 2026: Midjourney SCANNER, V8.2 Preview, Bigger Batches & More

Woollyfern·7月1日週三·9 min英文

三句話摘要

Midrani公司推出全身超聲波掃描器硬體產品,同時釋出影象生成工具v8.1的Draft Mode和v8.2預覽版更新。 Midrani透過開發成本低廉的超聲波掃描硬體探索醫療應用新方向,而其影象生成平臺透過Draft Mode和逐步迭代的版本更新持續最佳化創作工具,兩個方向都體現了該公司在各自領域追求創新與使用者體驗的承諾。 Midrani Scanner採用Butterfly Network的晶片技術(40個晶片、數千微型感測器),透過水和聲波無輻射地生成高解析度3D身體內部影象。該技術成本低廉、速度超快,首期應用於健康檢查而非診療,雖與FDA合作但診療應用需要長期臨床驗證。

重點整理

重點
  • 1

    Midrani Scanner採用Butterfly Network的晶片技術(40個晶片、數千微型感測器),透過水和聲波無輻射地生成高解析度3D身體內部影象。該技術成本低廉、速度超快,首期應用於健康檢查而非診療,雖與FDA合作但診療應用需要長期臨床驗證。

  • 2

    Midrani建立獨立醫學分部證明公司多元化發展,硬體和影象生成團隊完全分離運作,表明影象生成業務並未停止,而是縱向擴充套件。產品透過新建Midrani Spa推向市場,融合硬體體驗與生活方式。

  • 3

    Draft Mode透過一次生成24張影象、成本減半的方式,讓創作者高效探索提示詞效果。配合sref random功能可一次性體驗24種不同風格,大幅提高創意流程的速度和靈活性。

  • 4

    技術路線清晰,v8.2即將釋出改進美感和提示詞遵循,v9採用更大規模模型和資料訓練預計年內推出。編輯器分階段釋出,優先推出OREF類功能,最終將支援多參考能力,計劃時間表具體但保守。

實用技巧與重點

乾貨
  • Midrani Scanner硬體規格:
  • 晶片技術:Butterfly Network超聲晶片
  • 晶片數量:40個,每個包含數千微型感測器
  • 掃描時間:約60秒
  • 成本對比:為MRI十分之一
  • 速度對比:比MRI快60倍
  • 掃描介質:水和聲波,無輻射無強磁場
  • 當前狀態:原型機,不使用AI
  • 首期應用:身體成分對映(健康檢查工具)
  • 合作單位:與FDA合作
  • Midrani Spa地點與規模:
  • 位置:舊金山Union Square附近
  • 面積:25,000平方英尺
  • 樓層:四層
  • 初期掃描器數:10臺
  • 配套設施:熱水浴、冷水浸、桑拿
  • 目標開業時間:2027年底前
  • 長期目標:2031年前全球50,000臺掃描器,月產能10億次掃描
  • Midrani其他專案:
  • 共4個硬體專案在開發
  • 年內將公佈2個可購買持有的硬體專案
  • 多個秘密軟體專案進行中
  • 大多數秘密專案以創意為核心
  • Midjourney v8.1 Draft Mode:
  • 一次生成影象數:24張
  • 成本:標準工作的一半
  • 啟用方式:點選提示欄右側閃電按鈕
  • 支援模式:relax和fast
  • sref random特性:每張影象使用不同隨機sref程式碼(隨機值範圍0到約42億)
  • 微調方式:點選喜歡的影象觸發subtle variation工作
  • v8.2預覽版(--preview引數):
  • 主要改進:美感、提示詞遵循度
  • 已知問題:偶爾產生不需要內容、連貫性問題
  • 預期釋出時間:下週或兩週內
  • v9訓練進展:
  • 狀態:早期訓練已開始
  • 定位:v8的擴大版本(更大模型、更多資料)
  • 非架構性改變
  • 無具體釋出時間表,計劃年內推出
  • 主要改進:身體連貫性增強
  • 編輯器(Editor)開發:
  • 優先順序:當前最高
  • 釋出策略:分階段增量釋出
  • 首先推出:OREF類似功能
  • 最終功能:多參考能力(組合場景、角色、物體)
  • 已知問題與建議:
  • Tile引數在v8.1中產生淡淡邊框,建議使用v7處理
  • OREF當前限制:v8.1網頁介面可新增OREF影象但執行時使用v7
  • NG8訓練進行中
  • v2影片模型計劃在v9之後釋出

結論

結論

Midrani透過開發成本低廉的超聲波掃描硬體探索醫療應用新方向,而其影象生成平臺透過Draft Mode和逐步迭代的版本更新持續最佳化創作工具,兩個方向都體現了該公司在各自領域追求創新與使用者體驗的承諾。

完整解析

詳細

Midrani在六月的更新中最令人意外的訊息是推出了首個硬體專案——Midrani Scanner,一臺全身超聲波掃描器。這個硬體專案需要澄清的是,Midrani並非放棄其核心的影象生成業務,而是建立了獨立的Midrani Medical分部,由大約9人的專業團隊專門從事醫療硬體開發,與負責影象模型的主團隊完全分離。這種結構設計反映了公司在保持核心業務專注的同時,對新領域的戰略性探索。

Midrani Scanner的工作原理創新獨特。使用者站立在一個平臺上,該平臺逐漸下降進入裝滿水的池體,周圍環繞的感測器環從各個角度持續傳送和接收超聲波。整個掃描過程僅需約60秒,即可生成高解析度的3D身體內部影象。該裝置採用了Butterfly Network的超聲波晶片技術,由40個晶片組成,每個晶片內整合數千個微型的獨立感測器。從效能指標看,這項技術相比MRI具有顯著優勢:掃描成本約為MRI的十分之一,掃描速度快60倍,且完全無輻射、無需強磁場,僅依靠水和聲波工作。需要特別說明的是,現階段的原型機並未使用任何AI技術參與影象生成,完全依賴硬體能力。

產品的首個應用場景被定位為身體成分對映,作為一個健康檢查工具而非診療工具。雖然Midrani正與FDA合作推進這項技術的發展,但要進入診療應用領域需要進行大量的臨床驗證,這個過程需要相當長的時間投入。從現有的資訊來看,Midrani Scanner並非意圖取代MRI,而是作為醫療工具箱中的補充工具,特別適合提供低成本、高可及性的預防性健康篩查。關於消費者最終購買成本和使用者資料處理等關鍵問題,講者強調團隊認真對待這些問題,並建議感興趣的人閱讀Midrani的最新博文以獲取更多關於開發過程的細節。

Midrani Scanner推向市場的策略同樣引人注目。公司計劃透過建立Midrani Spa來進行首輪推出,這是一個融合硬體體驗與生活方式的創新模式。他們在舊金山Union Square附近租賃了一個25,000平方英尺、共四層樓的場所,預計在2027年底前正式開業。初期配置將包括10臺掃描器,並配套熱水浴、冷水浸和桑拿等設施,創造一個綜合的健康體驗空間。公司的長期目標更加宏大:到2031年在全球部署50,000臺掃描器,實現月產能10億次掃描,這是一個極具雄心的發展目標。講者也坦誠地指出,希望未來能看到非Spa渠道的使用選項出現,因為傳統Spa環境不一定能被所有人接受和使用。最後值得一提的是,Midrani是一個完全由社群資助的實驗室,正因為其在影象生成領域取得的成功,才有能力投入資源開發如此具有野心的硬體專案。此外,Midrani還有四個硬體專案在開發中,其中兩個將在今年公佈,且這兩個專案是使用者可以購買和持有的,還有多個秘密的軟體專案也在推進中。

在影象生成軟體方面,v8.1現已成為預設模型,並推出了期盼已久的Draft Mode功能。Draft Mode是一個低解析度、低成本的操作模式,能在單次執行中生成24張影象,成本僅為標準工作的一半。使用者可以透過點選提示欄右側的閃電按鈕來啟用這個模式,這是快速評估提示詞效果和探索創意可能性的理想工具。當使用者找到滿意的結果後,只需點選"subtle variation"按鈕,系統即會在使用者設定的預設解析度下執行高質量版本,例如如果使用者設定HD為預設解析度,則會生成HD質量的影象。Draft Mode支援relax和fast兩種執行模式,為使用者提供了成本和速度之間的靈活選擇。

Draft Mode與sref random功能結合使用帶來了特別有趣的應用可能。Sref random會為Draft Mode生成的24張影象分別賦予不同的隨機風格程式碼,讓使用者能在一次執行中瀏覽24種完全不同的風格選項。這種組合使風格探索變得高效且富有探險精神,講者在其Patreon平臺上分享了更多關於這種用法的具體技巧。另一個v8.1的新功能是--preview引數,使用者可以透過這個引數嘗試即將釋出的v8.2的早期版本。根據目前的反饋,包括講者本人在內的使用者對該預覽版本的效果反應積極,特別是在個性化和情緒板方面表現出色,但偶爾會產生不需要的內容和連貫性問題。開發團隊正在修復這些問題,因此該預覽模型不應被視為穩定版本。v8.2的最終版本預計在一到兩週內釋出,其主要改進集中在美感和提示詞遵循度方面。

在技術發展路線圖方面,v9的早期訓練已經開始。v9被定位為v8的擴大版本,採用更大的模型規模和更多的資料,而非進行架構上的根本性改變。雖然沒有具體的釋出時間表,但預計將在今年內推出。較大的資料集整合過程似乎略微延緩了訓練進度。相比v8.2,v9的主要改進將集中在身體連貫性的增強上,而這個功能改進是與v8.2分別的。編輯器功能目前是團隊優先順序最高的工作項,大部分團隊成員投入其中。計劃採用分階段的增量釋出方式,首先推出類似OREF的功能,然後是其他功能。最終的編輯器將支援多重參考能力,使使用者能更無縫地組合場景、角色和物體等元素。目前如果使用者在v8.1中使用OREF,雖然網頁介面允許新增OREF影象,但執行時仍會使用v7版本,因為OREF功能在v8.1中尚未可用。

講者還提到了一些已知問題和使用建議。v8.1中的tile引數是一個已知問題,經常在影象邊緣產生淡淡的邊框,這會破壞無縫圖案的效果。開發團隊表示這個問題可能無法在v8.1中修復,但可能會在v8.2中嘗試解決,但不作保證。如果使用者需要使用tile引數建立無縫圖案,講者建議使用v7模型,可以透過在提示詞中新增--v7引數或在設定中選擇v7作為預設模型來實現。此外,NG8的早期訓練也在進行中,v2影片模型的釋出預計將在v9之後進行。由於講者即將度假,如有任何重大釋出會在其Patreon社群釋出訊息通知,完整的影片演示則需要等待其返回。講者還提到了其在Patreon上的Midjourney初學者課程,最近已新增到$25月度級別,為感興趣的使用者提供了更經濟實惠的學習選項。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。