StepFun เปิดตัว Step 5 Preview: 600B พารามิเตอร์แต่เปิดใช้งาน 27B เพียงอย่างเดียว, ค่าบริการ 1 ดอลลาร์ต่อ 1 ล้าน token, เปิดตัวเวอร์ชันน้ำหนัก 10/15

เมื่อวันที่ 20 กันยายน บริษัท StepFun จากจีนเปิดตัว Step 5 Preview ซึ่งใช้โมเดล 600B sparse MoE โดยเปิดใช้งานเพียง 27B ต่อ token, มีบริบทความยาว 1 ล้าน token, API เปิดให้ใช้ในวันเดียวกัน โดยคิดค่าบริการ 1 ดอลลาร์ต่อ 1 ล้าน token และจะเปิดตัวเวอร์ชันน้ำหนักในวันที่ 15 ตุลาคม การเสนอราคาที่ถูกและการเปิดให้ใช้ร่วมกันทำให้เป็นจุดเด่น

StepFun เปิดตัว Step 5 Preview: 600B พารามิเตอร์ แต่เปิดใช้งาน 27B เพียง 1 ดอลลาร์, ส่วนลด 10/15

ผู้พัฒนาระบบหลังบ้านจากสตาร์ทอัพในไทเปต้องอธิบายกับฝ่ายการเงินทุกเดือนว่า ทำไมใบเรียกเก็บ API ถึงเกินงบ

ผลิตภัณฑ์ของเขาให้ AI อ่านสัญญาทั้งหมดแล้วตอบคำถาม สัญญาหนึ่งอาจมีหลายแสนโทเค็น การเรียกใช้ครั้งหนึ่งก็เป็นค่าใช้จ่ายหนึ่งครั้ง การลดราคาต่อโมเดลจาก 3 ดอลลาร์เป็น 1 ดอลลาร์ไม่ได้เพียงแค่ประหยัด 2/3 แต่เป็นปัจจัยสำคัญที่ทำให้ฟีเจอร์นี้ยังคงดำเนินต่อไป

เมื่อวันที่ 20 กันยายน เขาได้มีตัวเลือกใหม่

บริบทเหตุการณ์

บริษัท StepFun ของจีนได้เปิดตัว Step 5 Preview และเปิด API ในวันเดียวกัน แม้จะไม่เป็นผู้ใหญ่ในตลาดโมเดลจีน แต่ในด้านโมเดลหลายรูปแบบและความยาวบริบทได้มีการพัฒนาอย่างต่อเนื่อง

เพื่อเข้าใจตำแหน่งของการเปิดตัวครั้งนี้ ควรดูคำอธิบายของตนเอง StepFun บนบัญชีสังคมออนไลน์ของตนกล่าวว่า Step 5 Preview เป็นผลิตภัณฑ์ใหม่สำหรับ “งานแบบตัวแทน” (agentic work) ที่มีประสิทธิภาพระดับล้ำสมัยในงานวิศวกรรมซอฟต์แวร์และงานความรู้เฉพาะ และเน้นความสามารถในภาคการเงิน

กล่าวอีกนัยหนึ่ง มันไม่ใช่เครื่องมือสนทนา แต่เป็นเครื่องมือทำงานให้คุณ

จุดเด่นของครั้งนี้

ตามข้อมูลจากการเปิดตัวของ StepFun และสื่อเทคโนโลยีหลายแห่ง รายละเอียดของ Step 5 Preview มีดังนี้

  • สถาปัตยกรรม sparse MoE ที่มี 600B พารามิเตอร์ทั้งหมด / เปิดใช้งาน 27B ต่อโทเค็น
  • ชั้น 92 ชั้น ที่แคบแต่ลึก – เป็นการเลือกสถาปัตยกรรมที่ไม่ค่อยพบเห็น
  • ความยาวบริบท 1 ล้านโทเค็น
  • มีความสามารถด้านภาพ
  • API เปิดให้ใช้ในวันเปิดตัว
  • ราคาต่อ 1 ล้านโทเค็นอินพุต 1 ดอลลาร์, เอาต์พุต 2.70 ดอลลาร์ พร้อมส่วนลดค้างคา 95%
  • เปิดเผยเวอร์ชันน้ำหนักในวันที่ 15 ตุลาคม – API ใช้งานได้แล้ว แต่เวอร์ชันน้ำหนักยังไม่เปิดเผย

หน่วยงานประเมินภายนอก Artificial Analysis ให้คะแนน 44 ใน Intelligence Index ซึ่งเทียบเท่ากับ Kimi K3 Max ค่านี้ควรใช้เป็นอ้างอิง เพราะดัชนีรวมเดียวไม่สามารถสะท้อนประสิทธิภาพงานเฉพาะได้ และเวอร์ชัน Preview ยังอาจมีการปรับปรุงต่อไป

การวิเคราะห์ผลกระทบต่อตลาด

สำหรับผู้ใช้ในไทเป

ผู้ใช้ทั่วไปจะไม่พบกับมันโดยตรง – StepFun ไม่มีผลิตภัณฑ์ด้านผู้บริโภคเช่น ChatGPT หรือ Claude ที่โปรโมทในไทเป แต่คุณจะได้รับประโยชน์โดยอ้อม: เมื่อค่าใช้จ่ายต่อโมเดลลดลงอย่างต่อเนื่อง บริการซอฟต์แวร์ในไทเปจะมีความสามารถมากขึ้นในการฝังฟังก์ชัน AI ลงในผลิตภัณฑ์ แทนที่จะต้องทำให้เป็นการซื้อเพิ่มเนื่องจากต้นทุนการประมวลผลสูง

สิ่งสำคัญคือการจัดการข้อมูล ข้อมูลที่ส่งไปยัง API ของผู้ผลิตโมเดลจีนมีการจัดเก็บและส่งข้อมูลในตำแหน่งที่ต่างจากผู้ให้บริการสหรัฐฯ และกฎหมายท้องถิ่นมีข้อกำหนดที่แตกต่างกัน ผู้ใช้ส่วนบุคคลอาจส่งข้อมูลสาธารณะได้โดยไม่มีปัญหา แต่ข้อมูลส่วนบุคคลหรือความลับทางธุรกิจต้องพิจารณาอย่างรอบคอบ

สำหรับการใช้งานองค์กร

องค์กรต้องดูที่ส่วนลดค้างคา 95%

ตัวเลขนี้สำคัญกว่าคะแนนโมเดล เพราะการร้องขอขององค์กรมักมีเนื้อหาซ้ำกันจำนวนมาก – คู่มือผลิตภัณฑ์เดียวกัน, คำแนะนำระบบเดียวกัน, ข้อบังคับกฎหมายเดียวกัน – ทุกครั้งที่เรียกใช้จะส่งข้อมูลซ้ำ การมีส่วนลดค้างคาสูงหมายความว่าบางส่วนของการเรียกใช้จะไม่คิดค่าใช้จ่ายจริง สำหรับแชทบอทบริการลูกค้า, คำถาม-ตอบเอกสาร, การตรวจสอบสัญญ การออกใบแจ้งหนี้จริงอาจแตกต่างมากกว่าราคาแสดง

แต่ก่อนนำไปใช้องค์กรต้องผ่านสองอุปสรรค: 1) การปกครองข้อมูล – การส่งข้อมูลลูกค้าหรือเอกสารภายในไปยัง API ของจีนอาจถูกกีดกันในหลายอุตสาหกรรมในไทเป (การเงิน, การแพทย์, การจัดซื้อของรัฐบาล) ซึ่งเป็นปัญหากฎหมาย ไม่ใช่ปัญหาทางเทคนิค 2) ความยั่งยืน – ราคาต่อโมเดล Preview และเงื่อนไขบริการอาจเปลี่ยนแปลง การผูกติดฟังก์ชันหลักกับเวอร์ชัน Preview มีความเสี่ยง

สำหรับนักพัฒนา

วันที่ 15 ตุลาคมเป็นวันที่สำคัญที่สุดสำหรับนักพัฒนา

หากเวอร์ชันน้ำหนักถูกปล่อยตามกำหนด คุณจะสามารถนำโมเดลนี้ไปรันบนเครื่องของคุณเอง – ไม่ต้องส่งข้อมูลออกไป, ควบคุมต้นทุน, สามารถปรับแต่งได้ สำหรับทีมในไทเปที่ต้องการข้อมูลที่อยู่ในประเทศแต่ต้องการโมเดลขั้นสูง นี่คือเส้นทางที่เป็นจริง 600B พารามิเตอร์ดูน่ากลัว แต่การเปิดใช้งาน 27B หมายความว่าการประมวลผลต้องใช้ทรัพยากรน้อยกว่ามีโมเดลหนาแน่น ซึ่งเป็นจุดเด่นของสถาปัตยกรรม sparse MoE

แต่ต้องคำนวณฮาร์ดแวร์ให้ชัดเจน sparse MoE แม้จะเปิดใช้งานพารามิเตอร์น้อย แต่ต้องโหลดน้ำหนักของผู้เชี่ยวชาญทั้งหมดเข้าไปในหน่วยความจำ ไฟล์โมเดล 600B มีความต้องการทรัพยากรสูง ไม่ใช่การ์ดจอระดับผู้บริโภค สามารถทำได้โดยการเช่า GPU บนคลาวด์ หรือรอให้ชุมชนปล่อยเวอร์ชันที่ถูกบีบอัด

แนวโน้มการพัฒนาในอนาคต

การเปิดตัวครั้งนี้เป็นการต่อเนื่องของรูปแบบที่ดำเนินมาตลอดหนึ่งปี: ผู้ผลิตโมเดลจีนใช้ “ราคาต่ำ + เปิดเผยน้ำหนัก” เพื่อผลักดันตลาดให้ราคาลดลง

ผลลัพธ์ของกลยุทธ์นี้เห็นได้ชัดแล้ว ในปีที่ผ่านมา ราคาต่อ 1 ล้านโทเค็นของโมเดลล้ำสมัยลดลงอย่างต่อเนื่อง ส่วนหนึ่งของแรงกดดันมาจากการเปิดเผยและการแข่งขันราคาต่ำ นี่เป็นประโยชน์ต่อผู้ใช้ แต่ก็เป็นสิ่งที่ควรพิจารณา: เมื่อราคาประมวลผลใกล้เคียงต้นทุน ผู้ผลิตโมเดลจะหาแหล่งกำไรจากไหน? คำตอบมักจะเป็นการยกระดับด้านอุปกรณ์ (ชิปพัฒนาตนเอง, ศูนย์ข้อมูลของตนเอง) หรือด้านล่าง (สร้างแอปพลิเคชัน, แพลตฟอร์มตัวแทน) ซึ่งเป็นเส้นทางที่เราได้พูดถึงในบทความ <Anthropic ร่วมมือกับ Samsung เพื่อชิปการประมวลผลแบบกำหนดเอง>

แนวโน้มที่สองคือ “งานแบบตัวแทน” กำลังทดแทน “การสนทนา” เป็นตำแหน่งการตลาดหลักของโมเดล Step 5 Preview มีการใช้คำว่า agentic, วิศวกรรมซอฟต์แวร์, งานความรู้เฉพาะอย่างต่อเนื่อง ไม่ได้พูดถึงประสบการณ์การสนทนา นี่สะท้อนการเปลี่ยนแปลงความต้องการของตลาด – ลูกค้าที่จ่ายเงินต้องการโมเดลที่ทำงานต่อเนื่องหลายชั่วโมงจนเสร็จสิ้น ไม่ใช่โมเดลที่แค่สนทนา

แนวโน้มที่สามที่ควรติดตามคือ “เปิดตัว Preview ก่อน, เปิดเผยน้ำหนักหลัง” การปล่อยในรูปแบบนี้ช่วยให้ผู้ผลิตสามารถรวบรวมข้อมูลการใช้งานจริงก่อนตัดสินใจ และให้ผู้ใช้มีจุดตรวจสอบที่ชัดเจนว่าเวอร์ชันน้ำหนักจะเปิดเผยหรือไม่ วันที่ 15 ตุลาคมจะเป็นตัวชี้วัดสำคัญมากกว่าคะแนนประเมินใด ๆ

สรุปและความคิดเห็นของ TheAI Academy

ฉันมักมีมุมมองที่เป็นจริงต่อการเปิดตัวแบบนี้: สเปคที่ดีไม่จำเป็นว่าคุณจะใช้ได้

สิ่งที่ทำให้ Step 5 Preview น่าสนใจจริง ๆ มีสองอย่าง: 1) การเลือกสถาปัตยกรรม 92 ชั้นที่แคบแต่ลึก – เมื่อหลายคนเลือกขยายขนาดและความกว้าง การเพิ่มจำนวนชั้นเป็นการตัดสินใจทางเทคนิคที่ชัดเจน มักเกี่ยวข้องกับความสอดคล้องของการ推理ในบริบทยาว ซึ่งการติดตามผลการทดสอบจริงจึงคุ้มค่า 2) ส่วนลดค้างคา 95% – นี่คือตัวเลขที่สำคัญสำหรับผู้ที่ทำงานปริมาณมาก ไม่ใช่สำหรับผู้ชมการเปิดตัว

คะแนน 44 จาก Artificial Analysis เทียบกับ Kimi K3 Max ควรใช้เป็นอ้างอิงเท่านั้น ความแตกต่างของการใช้งาน (อ่านสัญญาหรือเขียนโปรแกรม, ภาษาไทยหรืออังกฤษ, ต้องการความแม่นยำรูปแบบหรือไม่) มีผลต่อประสบการณ์จริงมากกว่าคะแนนรวม

ความคิดเห็น: สิ่งที่ควรบันทึกในปฏิทินจริง ๆ ไม่ใช่การเปิดตัววันนี้ แต่เป็นวันที่ 15 ตุลาคม – เวอร์ชันน้ำหนักจะเปิดเผยตามกำหนดหรือไม่ และเงื่อนไขการอนุญาตจะเป็นอย่างไร นั่นคือสิ่งที่กำหนดว่ามีประโยชน์ต่อทีมในไทเปหรือไม่

คำแนะนำเฉพาะสำหรับนักพัฒนาที่อยู่ในไทเป: หากคุณมีแอปพลิเคชันที่ต้องการบริบทยาวและเนื้อหาซ้ำ (คำถาม-ตอบเอกสาร, การจัดการสัญญ, ฐานความรู้บริการลูกค้า) ควรใช้เวลาสักครึ่งวันทำการทดสอบกับข้อมูลจริงของคุณ เปรียบเทียบ 3 ด้านหลัก – ความแม่นยำในการเข้าใจภาษาไทย, อัตราการใช้ส่วนลดค้างคา, ความเสถียรในบริบทยาว การทดสอบสามารถใช้คำสั่งจาก <ฐานตัวอย่างคำสั่ง> ที่เราเตรียมไว้เพื่อเปรียบเทียบโมเดล แต่ก่อนที่คุณจะส่งข้อมูลลูกค้าในสภาพแวดล้อมจริง ควรทำความเข้าใจเรื่องการปกครองข้อมูลให้ชัดเจน

หากความต้องการของคุณคือการติดตั้งในสถานที่จริง ให้มุ่งเน้นที่วันที่ 15 ตุลาคม ในระหว่างนั้น การตัดสินใจด้านสถาปัตยกรรมควรคงความยืดหยุ่นเพื่อเปลี่ยนโมเดลได้

แหล่งข้อมูล

ข้อมูลสรุปตามข้อมูลสาธารณะและการประกาศอย่างเป็นทางการ ข้อความนี้ไม่ถือเป็นคำแนะนำการลงทุน

คำถามที่พบบ่อย

600B พารามิเตอร์แต่เปิดใช้งาน 27B หมายความว่าอย่างไร?

นี่คือสถาปัตยกรรม sparse MoE (Mixture of Experts) ที่มีหลาย “ผู้เชี่ยวชาญ” (expert) แต่เมื่อประมวลผล token แต่ละตัวจะเลือกใช้เฉพาะบางส่วนของผู้เชี่ยวชาญเท่านั้น ทำให้มีพารามิเตอร์ทั้งหมด 600B แต่จริง ๆ แล้วมีเพียง 27B ที่ทำงานในแต่ละครั้ง ข้อดีคือการคำนวณที่ต้องใช้ใน inference ต่ำกว่ารุ่น dense ขนาดเท่า ๆ กัน ทำให้ค่าใช้จ่ายต่ำลง แต่ข้อเสียคือพารามิเตอร์ทั้งหมดของผู้เชี่ยวชาญยังต้องเก็บในหน่วยความจำ ทำให้ความต้องการฮาร์ดแวร์ยังคงสูง

ทีมในไต้หวันสามารถนำไปติดตั้งบนเครื่องของตนเองได้หรือไม่?

ยังไม่สามารถทำได้ ต้องรอการเปิดตัวเวอร์ชันน้ำหนักในวันที่ 15 ตุลาคม และแม้ว่าจะมีน้ำหนักแล้ว การใช้ sparse MoE ยังต้องโหลดน้ำหนักทั้งหมด 600B เข้าไปในหน่วยความจำ ซึ่งไม่เหมาะกับ GPU ระดับผู้บริโภค ทีมส่วนใหญ่จึงเลือกเช่า GPU บนคลาวด์ หรือรอให้ชุมชนปล่อยรุ่นที่ถูกคอมเพรส (quantized) นอกจากนี้ การอนุญาตใช้งานยังขึ้นกับข้อตกลงการใช้ ไม่ใช่การเปิดน้ำหนักเท่านั้นที่หมายถึงการใช้เชิงพาณิชย์

ทำไมส่วนลดการแคช 95% จึงสำคัญกว่าราคาต่อหน่วย?

เนื่องจากการใช้งานในองค์กรมักมีคำขอที่ซ้ำกันจำนวนมาก เช่น คู่มือผลิตภัณฑ์เดียวกัน คำแนะนำระบบเดียวกัน หรือกฎหมายชุดเดียวกัน การแคช 95% หมายความว่าคำขอที่ซ้ำกันนั้นแทบไม่คิดค่าใช้จ่ายเลย สำหรับแอปพลิเคชันเช่น chatbot การตอบคำถามเอกสาร หรือการตรวจสอบสัญญ ความแตกต่างของค่าใช้จ่ายจริงอาจใหญ่กว่าราคาต่อหน่วยที่ประกาศ ดังนั้นควรประเมินโดยใช้โครงสร้างคำขอจริงของตนเอง ไม่ใช่แค่เปรียบเทียบราคาตามตาราง

มีอะไรที่ต้องระวังเมื่อใช้ API ของผู้ผลิตจีน?

ส่วนใหญ่เป็นเรื่องการจัดการข้อมูลและความสอดคล้องกฎหมาย ไม่ใช่เรื่องเทคนิค ข้อมูลของคุณจะถูกส่งไปที่ไหน เก็บไว้นานแค่ไหน และกฎหมายท้องถิ่นมีข้อกำหนดอะไรบ้าง เกี่ยวกับการเก็บและเข้าถึงข้อมูลในสาขาไต้หวัน เช่น การเงิน การแพทย์ หรือสัญญารัฐบาล จะถูกตรวจสอบอย่างเข้มงวด และอาจถูกปฏิเสธโดยตรง การทดสอบด้วยข้อมูลสาธารณะเป็นเรื่องปลอดภัย แต่ก่อนส่งข้อมูลลูกค้าในสภาพแวดล้อมจริง ควรผ่านการตรวจสอบด้านกฎหมายและความมั่นคงของข้อมูลก่อนเสมอ

繁體中文版 →