有些 AIoT 產品會透過鏡頭取得用戶的臉部、身體或周遭物件,再根據影像提供辨識結果、動作提示,或把分析內容即時疊回畫面上。從用戶角度來看,這類產品就是「鏡頭拍攝、AI 辨識、畫面顯示結果」。但當鏡頭真的被放進一台裝置後,事情往往就沒有這麼單純。。
用戶操作產品時,不只是在面對一顆鏡頭。他同時會看螢幕上的內容、閱讀提示、調整站位,也會依照產品的高度、外型與擺放方式,自然地選擇一個舒服的位置。鏡頭則有自己的拍攝角度、視野範圍與適合辨識的位置。當這兩者沒有對上,即使模型本身可以正常辨識,用戶仍可能需要反覆移動、抬頭、轉身或調整距離,才能進入系統預期的畫面範圍。
例如,用戶站在螢幕前時,可以清楚看見畫面上的操作提示,鏡頭卻只取得部分臉部或身體;往後退雖然能讓身體完整進入畫面,螢幕上的文字與示範內容又變得不容易閱讀。功能不是完全不能用,但用戶必須不斷在「看清楚介面」與「配合鏡頭取像」之間調整。
這類問題很容易被歸因於模型不夠準、介面提示不夠清楚,或用戶沒有站好,但有些限制其實發生得更早!
鏡頭被放進產品的那一刻,就已經開始決定產品從什麼角度看用戶、能拍到哪些內容,以及後續軟體需要承擔多少裁切、對位與校正。
所以在設計 Camera-based AI 產品時,不能只確認鏡頭能不能拍到,也需要進一步確認它所在的位置。
鏡頭的位置會先決定產品真正看得見什麼
視野範圍(FOV)、結構遮擋
鏡頭被放在產品的哪一個位置,會先形成「產品」觀看用戶的角度。鏡頭較高、較低或偏向側邊,都會讓臉部、身體或物件以不同方式進入畫面。這不一定會讓功能完全失效,但可能讓真正需要分析的區域長期靠近畫面邊緣,或在某些角度下被遮擋。
不過,鏡頭位置影響的不只是拍攝方向。鏡頭模組本身可能具有足夠的視野範圍(FOV),但被裝進完整產品後,前方開孔的大小、鏡頭埋入外殼的深度,以及開孔與鏡頭光軸是否對齊,都可能進一步縮小實際可用的畫面。
例如,當鏡頭被放得較深,前方開孔卻沒有跟著放大時,外殼就像在鏡頭前形成一段狹窄的通道。鏡頭原本可以接收到的部分斜向光線會被內壁擋住,最後造成實際視野變窄,畫面邊緣也可能出現遮擋、暗角,或讓關鍵區域更容易落到可用範圍之外。規格上看起來是一顆廣角鏡頭,裝進產品後卻不一定還能保留原本的廣度。
在規劃產品外型與內部結構時,鏡頭開孔與安裝位置不能只被當成外觀細節。鏡頭放在哪裡、前方保留多少空間、開孔尺寸是否足夠,以及是否會遮到邊緣視角,都會直接影響最後的取像結果與產品體驗。
例如,為了讓產品正面看起來更完整,鏡頭可能被安排在較偏側的位置,或被藏在較深的結構裡。外觀上或許更乾淨,但當用戶站在介面引導的位置時,臉部或身體可能無法以系統需要的角度與範圍進入畫面。用戶必須再往後站、往旁邊移動,或調整身體角度,才能讓辨識繼續進行,可能影響用戶體驗、影響影像辨識品質等。
這些改變還可能連帶影響 AI 的判斷。因為當臉部、四肢或物件長期靠近畫面邊緣,影像可能被裁掉一部分,也可能因為廣角鏡頭邊緣的變形而改變比例。對需要定位臉部特徵、身體關節或物件輪廓的功能來說,真正可穩定使用的區域,往往會比鏡頭規格上的完整畫面更小。因此,規格上的 FOV 並不等於鏡頭裝進完整產品後的有效視野。產品真正能取得多少內容,還受到開孔尺寸、安裝深度、鏡頭角度、外殼遮擋與組裝誤差影響。
這類問題通常不能只靠換成視角更廣的鏡頭處理。從產品規劃角度來看,更廣的視角雖然可以涵蓋更多範圍,但也需要和工程團隊確認畫面邊緣的變形與後續校正需求,是否會進一步影響辨識結果與使用體驗。如果前方開孔本身不足,再廣的視角仍可能受到外殼遮擋。
比較合理的處理方式,通常是在工業設計與機構仍能調整時,一起確認鏡頭模組、開孔與實際使用情境。例如,縮短鏡頭到產品表面的距離、增加開孔尺寸、將開孔內側做成向外展開的斜面,或重新調整鏡頭的位置與角度,避免外殼直接遮住邊緣視野。這些選擇仍然需要和外觀、結構強度及內部空間一起取捨,不是單純把開孔放大就一定最好。
鏡頭一旦受到位置、光學開孔與產品結構限制,用戶的站位和操作方式也會跟著受到影響。到了這個階段,後續即使增加影像裁切、座標校正或介面引導,也無法還原原本沒有進入鏡頭的真實資訊。
然而,即使有效視野已經足夠,用戶自然看向的位置,也不一定正好是鏡頭希望他面向的位置。
用戶自然看向的位置,不一定是鏡頭希望他面向的位置
鏡頭光軸(Optical Axis)、用戶視線
再來是,即使鏡頭裝進產品後仍保有足夠的有效視野,用戶自然看向的位置,也不一定正好落在鏡頭最適合取像的方向。
當產品同時具有螢幕與鏡頭時,用戶的注意力通常會落在介面內容上。他可能正在閱讀提示、查看自己的畫面,或跟著螢幕上的示範操作,而不是一直確認鏡頭位於哪裡。這時候,螢幕內容所在的位置、鏡頭的安裝位置,以及鏡頭實際朝向的中心線,就會共同影響用戶最後呈現在畫面中的角度。
例如,用戶正在跟著螢幕完成伸展或動作練習時,視線自然會放在示範人物或操作提示上。如果鏡頭位於螢幕上方、下方或較偏側的位置,用戶雖然覺得自己正在面向產品,頭部、肩膀或身體實際上卻可能已經跟著介面內容轉向。最後,系統取得的就不一定是原本需要的正面畫面。
這種落差不一定會讓辨識立刻失敗。用戶可能仍然完整出現在畫面裡,模型也能找到臉部或身體,但某些特徵會因為角度而變得比較不穩定。例如,臉部轉向一側後,部分特徵可能被遮住;身體略微側轉時,左右關節可能在影像中重疊;原本需要正面觀察的區域,也可能因為視線與姿勢偏移而逐漸靠近畫面邊緣。
更麻煩的是,用戶通常不會意識到自己已經偏離鏡頭。他看到的是自己正對著螢幕,也能正常閱讀內容,因此容易認為目前姿勢沒有問題。當辨識結果開始不穩時,他可能只會覺得 AI 忽然變得不準,而不是理解螢幕與鏡頭之間存在位置落差。
這類問題有時還會形成連鎖反應。例如,用戶為了看清楚較小的文字或示範內容而靠近螢幕,可能離開原本適合取像的距離;為了確認自己是否站在畫面中央,又會反覆往左、往右移動。介面原本是為了幫助操作,最後卻可能間接改變用戶的站位與姿勢。因此,產品中其實同時存在三個需要對齊的方向:
1. 用戶自然狀態下觀看的區域、
2. 介面引導注意力的區域,
3. 以及鏡頭最適合取像的方向。
三者若沒有合理配合,用戶就必須在「看清楚內容」與「讓鏡頭看清楚自己」之間反覆調整。
這裡的解法不只是增加一句「請看向鏡頭」。比較合理的做法,是在產品設計階段就一起確認鏡頭、螢幕與主要內容區域的相對位置。
當條件允許時,鏡頭應盡量靠近用戶主要觀看區域,或透過調整安裝角度,讓用戶自然站立與觀看介面時,仍落在較合適的取像方向。
介面中的主要操作按鈕、示範內容與狀態提示,也需要和鏡頭的取像需求一起安排,避免不同資訊把用戶的注意力帶向不同方向。尤其當用戶需要一邊觀看示範、一邊維持正面姿勢時,介面內容的位置與鏡頭配置就必須一起納入設計,才能讓整體操作更自然。
另外,如果鏡頭與螢幕的位置已受到產品結構限制,介面引導仍然可以降低部分問題,例如用清楚的輪廓提示目前取像範圍,讓用戶知道頭部或身體是否逐漸偏離;也可以在真正需要穩定取像的短暫階段,減少會把視線帶往其他位置的內容。不過,這些方法主要是在降低操作負擔,無法完全消除不合理的鏡頭與螢幕位置關係。
因此,這不是單純的外觀配置,也不是後續補上一個提示就能解決,而是「產品如何觀看用戶」與「用戶如何觀看產品」之間的關係。
並且當單一鏡頭難以完全配合產品需求,並涵蓋用戶自然觀看與活動的範圍時,有些產品會進一步加入第二個或更多鏡頭;但鏡頭增加後,系統需要處理的就不只是「有沒有拍到」,還包括不同鏡頭取得的畫面能否持續對應。
多鏡頭提供更多資訊,但也增加影像之間的對應成本
多鏡頭、視差(Parallax)、影像對位
當單一鏡頭無法同時配合產品結構,又涵蓋用戶自然觀看與活動的範圍時,有些產品會加入第二個或更多鏡頭,分別取得不同方向、區域或類型的影像。多鏡頭確實可以補足單一視角的限制,但它不只是多取得一份畫面。因為每個鏡頭放置的位置與朝向不同,即使同時拍攝同一個人或物件,畫面中的位置、比例與可見範圍也不會完全相同。
這種由觀看位置不同而產生的畫面差異,可以理解為視差。就像左右眼看同一個物件時,物件在兩邊視野中的位置會稍微不同;兩個鏡頭之間只要存在距離,也會看到不同角度的畫面。例如,兩個鏡頭在預設站位下,可能都能拍到用戶,畫面上的標記也能大致對在相近的位置。但當用戶往前靠近、移向側邊或轉動身體後,兩個鏡頭看到的輪廓、遮擋範圍與畫面位置就會跟著改變。原本貼合的標記,可能在其中一路影像仍然正常,到了另一個畫面卻開始偏移。
當不同鏡頭取得的影像需要對位或疊合時,系統還需要先建立它們之間的對應關係。但完成這類校正,不代表所有距離、角度與姿勢下都能維持相同效果。
當用戶靠近、移向側邊或改變姿勢後,兩個鏡頭看到的角度與遮擋情況也會改變,原本的對應關係仍可能出現偏差。
所以,在產品規劃上不能預設這些偏差都能交給軟體處理,而需要和工程團隊一起確認功能可以支援的使用距離、角度與活動範圍,以及超出範圍後,產品要如何提示用戶或調整操作流程。不同產品會有不同的處理方式,實際校正與工程實作仍需要由團隊依產品架構與使用情境判斷。
還有,實際組裝也會影響結果。鏡頭模組的位置或安裝角度只要出現細微公差,就可能改變原本建立的對應關係。因此,多鏡頭功能不能只根據設計圖上的相對位置判斷,也需要在開發樣機與量產階段持續檢測與驗證。
軟體可以校正,但無法補回沒有拍到的內容
影像校正・座標轉換
當辨識結果沒有正確貼回畫面,或多鏡頭之間出現位置偏差時,軟體確實可以透過校正改善其中一部分。但所有校正都有一個前提:鏡頭必須先取得足夠且可用的內容。
AI 找到的位置,通常是建立在原始影像的座標上;用戶看到的畫面,卻可能已經經過裁切、縮放、旋轉或左右鏡像。因此,系統還需要進行座標轉換,把辨識結果換算到實際顯示的畫面上。
例如,模型在原始影像中找到一個關節點,但介面顯示的是裁切後再放大的畫面。如果中間的比例、位移或鏡像關係沒有正確換算,模型找到的位置可能沒有錯,最後顯示的標記卻會偏到旁邊。這類規律性的偏差,通常可以透過軟體校正改善。
更重要的是,如果是鏡頭根本沒有取得需要的內容,軟體就無法可靠還原。例如,外殼遮住部分臉部、手臂超出有效視野,或側身後部分特徵被遮擋,座標轉換只能調整已經辨識到的位置,不能還原沒有進入畫面的真實資訊。
因此,在看這類問題時,我不會只問軟體還能增加多少修正,而會先確認:目前的偏差,是來自裁切、縮放與座標轉換沒有對上,還是鏡頭位置、產品結構與自然使用方式本來就存在衝突?
如果只是畫面顯示的位置沒有對好,通常還能透過軟體調整;但如果根本原因是鏡頭位置、產品結構與用戶自然使用方式彼此不合,再增加更多軟體修正,也只會讓系統變得更複雜,未必真正改善體驗。
當一個功能必須長期依靠軟體校正才能勉強維持可用,我認為,如果條件允許,最好回到實際產品裡,重新確認鏡頭位置、有效視野、使用距離與實際操作方式。
鏡頭位置需要在完整產品裡提早驗證
做 IoT 產品的時候,要考慮到鏡頭模組單獨測試正常,不代表裝進完整產品後仍能維持相同效果。外殼開孔、安裝深度、螢幕位置、產品高度與擺放方式,都可能改變實際取像條件。例如,鏡頭模組原本可以取得完整畫面,但裝進外殼後,視野可能受到開孔或結構限制;再加上用戶自然站立的位置與測試條件不同,真正穩定可用的範圍可能比預期更小。
因此,完整裝置驗證不能只確認畫面裡「有沒有拍到人」,還要觀察用戶自然會站在哪裡、看向哪裡,以及操作過程中是否會移動或轉身。這些行為是否仍落在鏡頭的有效視野與適合辨識的角度內,才是產品真正可用的範圍。
多鏡頭產品還需要確認,鏡頭裝進實際機構後,彼此的位置與角度是否仍符合原本的校正條件。組裝公差或安裝角度的細微差異,都可能影響影像對位,因此不能只根據設計圖或單一樣機判斷。
對於可能影響產品可用性與體驗的問題,產品經理通常不需要親自處理光學設計、演算法或技術校正,但至少需要理解問題可能發生在哪一層、會影響哪些使用情境,才能和工程及設計團隊共同判斷原因、驗證影響,並找出可行的處理方向。
因此,相關驗證最好在產品外型與結構仍有調整空間時進行,提早對齊取像範圍、使用距離與視線方向,而不是等鏡頭位置完全固定後,再依靠介面提示或軟體補償。
結語
在 Camera-based AI 產品裡,鏡頭不是裝進外殼後,再交給軟體適配的獨立元件。它的位置會影響有效視野、用戶站位與影像對位,也會改變後續軟體與介面需要承擔的補償程度。
因此,鏡頭配置不能只確認外觀是否完整、內部是否裝得下,或模組規格是否足夠。真正需要驗證的是,當鏡頭、外殼、螢幕與介面整合成完整產品後,用戶是否還是能以自然的距離、視線與姿勢完成操作。
鏡頭位置看似是一個硬體配置問題,但實際上卻會一路影響 AI 的辨識穩定性與特徵定位、軟體的影像處理與校正,以及 UX/UI 的用戶引導方式,最終也會直接影響整體用戶體驗。