Nội dung
- Song song token và giọng nói mở lại bài toán mô hình AI
- 150 ms, 450 lần và kênh phân phối AI phải tính lại
- Quyết định có confidence score sẽ đổi cách mua kênh AI
- Chưa xác nhận về GPT-6 Sol, Terra, Luna: người mua nên kiểm gì?
- Kênh tiếng Việt sẽ chọn mô hình AI bằng lượt hoàn tất
- Chạy thử Jev và Gemini Live trên một kênh trước khi tăng ngân sách
- Nguồn tham khảo
Các mô hình AI mới đang cạnh tranh không chỉ bằng câu trả lời hay hơn. Tốc độ phản hồi, giá mỗi lượt xử lý và khả năng nói rõ mức tự tin đang quyết định AI có đi được tới điểm chạm khách hàng hay chỉ nằm trong bản demo. Với marketer Việt Nam, thay đổi này làm chi phí tiếp cận và cách chọn kênh phải được tính lại.
Điểm chính
- Jev được giới thiệu với khả năng xử lý song song, tốc độ cao, chi phí thấp và confidence score cho các tác vụ ra quyết định.
- Speech to Speech đưa độ trễ và tỷ lệ hoàn tất tác vụ vào cùng bài toán với chất lượng nội dung.
- Khi chi phí suy luận giảm, lợi thế chuyển từ mua model đắt sang thiết kế nhiều điểm chạm có thể đo và kiểm soát.
- Các thông tin về dòng GPT-6 Sol, Terra, Luna mới là phỏng đoán cá nhân, chưa phải cơ sở lập ngân sách.
Song song token và giọng nói mở lại bài toán mô hình AI
Thị trường đang cho thấy hai hướng thay đổi có liên quan. Một hướng bỏ cách tạo văn bản tuần tự từng token để xử lý song song, nhắm vào quyết định nhanh với chi phí thấp. Hướng kia đưa AI vào cuộc hội thoại bằng giọng nói, nơi thời gian chờ và khả năng gọi công cụ ảnh hưởng trực tiếp đến việc người dùng có tiếp tục tương tác hay không.
Bài đăng của Dan Niles dẫn lại thông tin về Jev, mô hình do Diogo Almeida phát triển, với tuyên bố nhanh hơn khoảng 200 lần và rẻ hơn khoảng 450 lần so với các LLM dẫn đầu trong một số tác vụ ra quyết định. Bài đăng khác trích lời Almeida nêu Jev đạt độ trễ khoảng 150 ms, giá đầu vào 0,042 USD cho một triệu token và miễn phí token đầu ra. Đây là số liệu do bên phát hành và người dùng dẫn lại; marketer cần kiểm tra trên workload thật trước khi dùng để dự báo chi phí.
150 ms, 450 lần và kênh phân phối AI phải tính lại
Khối cập nhật dưới đây chỉ ghi nhận những tính năng hoặc chỉ số được nêu cụ thể trong các nguồn. Chúng chưa thay thế cho kiểm thử trên dữ liệu, ngôn ngữ và công cụ của từng doanh nghiệp.
Xử lý song song của Jev: giảm tiền cho các quyết định lặp lại
Jev được mô tả là model xử lý dữ liệu song song thay vì tạo token lần lượt. Nguồn của Dan Niles nêu mức nhanh hơn khoảng 200 lần, rẻ hơn khoảng 450 lần và có confidence score. Nguồn Shirish dẫn lại thông tin giá 0,042 USD cho một triệu token đầu vào, token đầu ra miễn phí và độ trễ khoảng 150 ms. Với đội marketing, điều này chạm tới chấm điểm lead, phân loại yêu cầu và chọn bước tiếp theo trong workflow, thay vì chỉ tạo bản nháp.

Speech to Speech có Extended Thinking: biến cuộc gọi thành kênh có thể đo
Gemini 3.8 Live được mô tả là model Speech to Speech có thể gọi tool và API trong khi vẫn tiếp tục hội thoại. Bài đánh giá của Artificial Analysis ghi biến thể Extended Thinking High đạt 82,6 trên Speech to Speech Index và 93,2% Task Success Rate trong phần chỉ số được trích dẫn. Điều đó khiến tổng đài, tư vấn sản phẩm và hỗ trợ sau mua phải đo thêm thời gian phản hồi, tỷ lệ hoàn tất và số lần chuyển sang người thật.
Quyết định có confidence score sẽ đổi cách mua kênh AI
Chi phí mỗi quyết định thấp làm nhiều điểm chạm cạnh tranh với một chatbot
Giá thấp chỉ tạo giá trị khi doanh nghiệp có đủ tình huống để sử dụng. Mức giá và độ trễ được nêu cho Jev trong bài đăng của Shirish kết hợp với khả năng làm việc theo quyết định trong bài đăng của Dan Niles gợi ra một thay đổi về kênh: AI có thể được đặt ở nhiều bước nhỏ như lọc form, trả lời câu hỏi trước mua và chọn nội dung tiếp theo.

Trước đây, mỗi điểm chạm mới thường kéo theo chi phí model, tích hợp và giám sát. Nếu chi phí xử lý giảm, khoản cần kiểm soát chuyển sang chất lượng dữ liệu, lỗi do máy chọn sai và thời gian nhân viên sửa. Vì vậy, không nên lấy giá token làm KPI duy nhất. Cần tính chi phí cho mỗi quyết định đúng và mỗi ca phải sửa.
Độ trễ giọng nói và confidence score cùng quyết định mức tự động hoá
Speech to Speech của Gemini 3.8 Live được Artificial Analysis đánh giá bằng các chỉ số về suy luận giọng nói, khả năng làm việc như agent, mức yêu thích và tỷ lệ hoàn tất. Jev lại được Dan Niles mô tả là có confidence score khi model không chắc chắn. Hai tín hiệu này cùng dẫn tới một nguyên tắc vận hành: kênh có thể mở rộng chỉ khi hệ thống biết lúc nào nên trả lời, lúc nào cần hỏi thêm và lúc nào chuyển cho người.
Confidence score không đồng nghĩa với độ đúng. Nó chỉ là tín hiệu để đặt ngưỡng kiểm tra. Đội marketing nên so sánh điểm này với kết quả thực tế trên từng nhóm câu hỏi, rồi đặt quy tắc chuyển người theo rủi ro thương hiệu và giá trị giao dịch.
Hiệu năng benchmark không thay thế được chi phí phân phối đến người dùng
Chỉ số 82,6 trên Speech to Speech Index của Artificial Analysis có ích để so sánh trong một bài đánh giá, nhưng không cho biết chi phí tích hợp vào CRM, tổng đài hay nền tảng quảng cáo. Các mức giá và tốc độ được nêu cho Jev trong nguồn của Shirish cũng chưa nói lên tỷ lệ chuyển đổi trên tệp khách hàng Việt.

Do đó, lựa chọn model phải đi từ kênh và công việc hoàn tất. Một model chậm hơn nhưng trả lời đúng câu hỏi sản phẩm có thể phù hợp với tư vấn giá trị cao. Một model rất nhanh chỉ có lợi khi doanh nghiệp có đủ lượt tương tác và cơ chế chặn lỗi.
Chưa xác nhận về GPT-6 Sol, Terra, Luna: người mua nên kiểm gì?
Liệu các kích thước GPT-6 có sớm thay đổi kế hoạch chọn model?
Đang lan một phỏng đoán trên bài đăng của Haider rằng OpenAI có thể phát hành một dòng GPT-6 gồm Sol, Terra và Luna, được chắt lọc từ Astra. Người đăng suy đoán lịch phát hành có thể liên quan đến sức bán của Astra và giới hạn năng lực tính toán. OpenAI không được dẫn là đã xác nhận các tên model, lịch phát hành hay cấu trúc này.
Điều dùng được: không đưa các tên trên vào kế hoạch mua công cụ hoặc cam kết hiệu quả. Hãy lưu benchmark hiện tại, giá thực tế, tỷ lệ lỗi và chi phí chuyển đổi để có thể so sánh nếu nhà cung cấp công bố sản phẩm chính thức.
Kênh tiếng Việt sẽ chọn mô hình AI bằng lượt hoàn tất
Ở Việt Nam, cơ hội rõ nhất nằm ở các kênh có nhiều lượt hỏi lặp lại và cần phản hồi nhanh: chat tư vấn, cuộc gọi xác nhận đơn, hỗ trợ sau mua và phân loại lead từ quảng cáo. Nhưng tiếng Việt theo vùng, tên sản phẩm, cách viết tắt và dữ liệu CRM làm cho con số benchmark quốc tế chỉ là điểm bắt đầu.

Marketer nên xem mỗi kênh như một bài kiểm thử riêng. Chat cần đo tỷ lệ trả lời đúng và tỷ lệ chuyển người. Voice cần đo thời gian chờ, số cuộc gọi hoàn tất và lỗi nhận giọng. Workflow nội bộ cần đo số quyết định đúng trước khi tính năng suất. Cách này giúp doanh nghiệp tránh mở rộng AI chỉ vì model có giá thấp hoặc đứng đầu một bảng điểm.
Chạy thử Jev và Gemini Live trên một kênh trước khi tăng ngân sách
- Chọn một công việc có đầu ra rõ, như phân loại lead hoặc trả lời nhóm câu hỏi sản phẩm, rồi ghi chi phí cho mỗi lượt đúng và mỗi lượt phải sửa.
- Đặt ngưỡng confidence, thời gian chờ và điều kiện chuyển sang nhân viên trước khi cho AI gọi tool hoặc trả lời khách.
- Kiểm thử riêng tiếng Việt, dữ liệu CRM và các tình huống nhạy cảm; không dùng điểm benchmark làm tiêu chí duy nhất.
- Đợi thông tin chính thức về các model chưa xác nhận, đồng thời giữ dữ liệu log để so sánh model theo kênh và theo công việc hoàn tất.
Xem thêm phân tích & hướng dẫn marketing tại https://marketing365.vn.
Theo dõi thêm các bài phân tích từ Marketing365 để cập nhật xu hướng marketing mới nhất.
Đọc thêm các bài cùng chuyên mục Động thái AI.
Nguồn tham khảo
- Dan Niles — thông tin về Jev, tốc độ, chi phí và confidence score
- Shirish — trích lời Diogo Almeida về Jev
- Artificial Analysis — đánh giá Gemini 3.8 Live
- Haider — phỏng đoán về dòng GPT-6 Sol, Terra, Luna



